信息速览
INFOBOX — XMedBench 一屏速览
维度 内容 本质 21,326 道六语言医疗四选项多选题评测基准——Apollo 医疗大模型论文(arXiv:2403.03640)三件套之一(ApolloCorpora 训练语料 / Apollo 模型 / XMedBench 评测基准) 团队 FreedomIntelligence(香港中文大学(深圳)+ 深圳大数据研究院),通讯作者 Benyou Wang(王本友),12 位作者 论文 Apollo: Lightweight Multilingual Medical LLMs towards Democratizing Medical AI to 6B People(arXiv:2403.03640,v1 2024-03-06 → v6 2024-10-12) 语言 英语 7,327 / 中文 8,759 / 法语 321 / 西班牙语 2,742 / 阿拉伯语 1,088 / 印地语 1,089(六文件逐一实测,合计 21,326) 格式 四字段 JSON:question / options((A)-(D) 换行分隔)/ answer((A) 式)/ source(上游标记) 构成 英:MedQA-USMLE+MedMCQA+MMLU 医学 6 子类|中:MedQA-MCMLE+CMMLU 7 子目录+CMB-single+CMExam|西:HEAD-QA|法:FrenchMedMCQA|阿/印地:MMLU 翻译版 定位 跨语言可比的医疗知识评测面:同一 MCQA 格式、同一 prompt 模板、六语同构 主结果 GPT-4 平均 73.37%;Apollo-7B 平均 58.78%——论文宣称 ≤70B 开源模型 SOTA(v6 主表) 覆盖宣称 六种使用最广语言,覆盖全球 6.1 十亿人口(论文摘要原话) 获取 HuggingFace FreedomIntelligence/XMedbench公开直链(Apache-2.0,约 33.4 MB,六个 JSON + zip 整包)许可 数据集 Apache-2.0;上游翻译组件(MMLU_Hindi/MMLU_Arabic)MIT;上游各考题库各随其源 库内互链 ApolloCorpus(训练语料姊妹对)、MedMCQA(英语最大上游)、CMB-CMExam(中文上游)、HeadQA(西班牙语上游)
XMedBench 是一份"把医疗知识考试翻译成六种语言"的评测基准:它不采集临床数据,而是把英语世界的医学考题传统(USMLE、MedMCQA、MMLU)与各语言本地的医学考试(CMMLU、HEAD-QA、FrenchMedMCQA)拉到同一个四选项多选题格式下,为医疗大模型提供一张跨语言可比的成绩单。它的出身决定了它的气质——这是 Apollo 医疗大模型项目的评测件,与训练语料 ApolloCorpora、模型权重同属一篇论文(arXiv:2403.03640),共同服务于一个雄心:让医疗 AI 覆盖六种使用最广的语言、约 6.1 十亿人口。
导语读法三则:
- 只想下数据跑评测:直奔 §6 获取与许可——Apache-2.0 公开直链,六个 JSON 文件直接可用,注意 options 字段的换行格式陷阱(坑 2)。
- 关心跨语言公平性:直奔 §3 任务设计与上游溯源——哪些语言是原生考题、哪些是翻译件,直接决定分数解读(坑 3)。
- 做模型对比:直奔 §4 评估体系与主结果——GPT-4、Qwen-72B、Apollo 系列在同一张表上的完整分数,以及复现实验时的 Chinese 切片"not used"之谜(坑 5)。
§0 导读:这个数据集解决什么问题
2023-2024 年之交,医疗大模型的评测版图高度偏科:英语世界有 MedQA、MedMCQA、PubMedQA、MMLU 医学子集,中文世界有 CMB、CMExam、CMMLU,但它们彼此格式不一、题量悬殊、字段各异——一个在 MedQA 上考 60 分的模型和另一个在 CMB 上考 60 分的模型,完全不可比。更刺眼的是语言覆盖:全球约 6.1 十亿人使用英、中、法、西、阿、印地六种语言,但彼时开源医疗 LLM 几乎只在英语上训练和评测,法语只有零星的 FrenchMedMCQA(321 题),阿拉伯语与印地语连一份像样的医疗评测集都没有。
XMedBench 的回答是一个"最大公约数"设计:全部题型统一为四选项单选 MCQA(Multiple-Choice Question Answering),全部数据统一为 question/options/answer/source 四字段 JSON,全部评测使用同一套 prompt 模板——在这个公约数之上,六种语言各自从最权威的题源填充:英语取 MedQA-USMLE 的 4-options 版本、印度 MedMCQA 的英语原题、MMLU 的医学相关 6 个子类;中文取 MedQA-MCMLE(USMLE 中文移植版)、CMMLU 医学 7 个子目录,并随机抽样 CMB-single 与 CMExam 各 2,000 题;西班牙语整片复用西班牙 HEAD-QA;法语复用 FrenchMedMCQA;阿拉伯语与印地语因缺乏本地医学考试数据,直接把 MMLU 医学部分翻译过去——论文自己称之为"make a compromise"(妥协)。
这份基准随着 Apollo 论文(arXiv:2403.03640)于 2024 年 3 月发布,与训练语料 ApolloCorpora(2.5B tokens)构成"训练 + 评测"的姊妹对。Apollo 系列模型(0.5B/1.8B/2B/6B/7B 五个尺寸)在 XMedBench 上刷出了当时 ≤70B 开源模型的最好成绩(Apollo-7B 平均 58.78%),而基准本身因 Apache-2.0 许可与极低的获取门槛(33.4 MB、六个 JSON),成为此后多语言医疗评测论文的常引用对象。
§0 读法三则:
- 这个条目是"评测基准 + 论文附件"二合一:本体是 21,326 道题,载体是 Apollo 论文——理解它的最好方式是同时理解 Apollo 项目想证明什么(§4、§5)。
- 全文硬数字均出自 hf-mirror API 实抓、六语言 JSON 文件逐一计数与论文 ar5iv 全文(v6),三个存照级冲突(发布日、上游链接互换、作者数)已在 §10 逐条存照。
- 检索时注意:HF 官方 id 是
FreedomIntelligence/XMedbench(b 小写),而论文与社区通篇写作 XMedBench(b 大写)——大小写敏感的检索器可能漏检(坑 1)。
§1 数据集速览:十问十答
Q1:XMedBench 到底有多少道题?
21,326 道,四选项单选。这个数字有三重印证:HF 页面索引 “Number of rows: 21,326”;六个语言 JSON 文件逐一计数求和恰为 21,326(7,327+8,759+321+2,742+1,088+1,089);HF API 的 size_categories 标注 10K<n<100K 与之相容。
Q2:六种语言各占多少?
英语 7,327、中文 8,759、法语 321、西班牙语 2,742、阿拉伯语 1,088、印地语 1,089(全部为本地实测值,非页面约数)。中文最大(41.1%),法语最小(1.5%,仅为英语的 4.4%)——语言体量不均是使用时的第一注意点。
Q3:题目长什么样?
每题四个字段:question 是题干(六语言各自原文);options 是形如 (A) paralysis of the facial muscles.\n(B) ...\n(C) ...\n(D) ... 的换行分隔纯文本;answer 是 (A) 式的字母标注;source 是上游来源标记(如 medmcqa、medqa-usmle、mmlu-medical)。注意 options 不是结构化数组——直接消费需要先按行切分(坑 2)。
Q4:这些题从哪来?
八个上游题源。英语:MedQA-USMLE(1,273 题,取 4-options 版本)+ MedMCQA(4,183 题)+ MMLU 医学 6 子类(1,871 题);中文:MedQA-MCMLE(3,426 题)+ CMMLU 医学 7 子目录(1,333 题)+ CMB-single(2,000 题)+ CMExam(2,000 题,后两者为随机抽样);西班牙语:HEAD-QA(全部 2,742 题);法语:FrenchMedMCQA(321 题);阿拉伯语与印地语:MMLU 医学部分的翻译版(论文口径)。
Q5:阿拉伯语和印地语的题是原创的吗?
不是。论文原文:“For Hindi and Arabic, which lack local assessments, we make a compromise by applying translated versions of MMLU.”——两种语言各 1,088/1,089 题全部来自 MMLU 医学相关部分的翻译。这是全基准最明确的局限之一,使用时不能把它们当作母语出题质量的证据(坑 3)。
Q6:它和 Apollo 模型是什么关系?
评测基准与被测模型同出一门:Apollo 论文同时发布了训练语料(ApolloCorpora,2.5B tokens)、五个尺寸的模型权重和这份基准。Apollo-7B 在 XMedBench 上平均 58.78%,论文宣称是 ≤70B 开源医疗模型中的 SOTA。这层"既当裁判又当运动员"的关系,读分数时要心里有数(§4.4)。
Q7:我能直接下载吗?
能。HuggingFace FreedomIntelligence/XMedbench,Apache-2.0,gated=false,整库约 33.4 MB:六个 test/{lang}.json + 六个 questions/{lang}_question.json(原始题目形态)+ 一个 XMedBench.zip 整包。大陆网络可走 hf-mirror.com 镜像,resolve 端点记得加 -L 跟随重定向(坑 4)。
Q8:有没有训练集?
没有。XMedBench 是纯测试基准(test config,6 个 split 对应六语言),不含训练划分。训练数据是它的姊妹数据集 ApolloCorpus——两者在论文里分工明确:一个喂模型,一个考模型。
Q9:怎么跑评测?
官方流水线在 GitHub FreedomIntelligence/Apollo:0.download_data.sh 下载数据 → 4.eval.sh 评测。Prompt 模板是论文 Figure 3 给定的单轮格式:“You are a medical doctor answering real-world medical exam questions. Select one correct answer from A to D…”(完整模板见 §3.4)。
Q10:为什么它对 AI-Ready 重要?
它是"低门槛高可用"的正面样本:Apache-2.0 许可、33.4 MB 体积、无 gated、无请求制、JSON 直读、字段极简。它的 AI-Ready 短板不在获取而在语义——options 非结构化、answer 带括号、六语言体量悬殊,这些都在 DAIMS 自评(§10.2)里逐项拆解。
§2 数据构成与规格
§2.1 六语言体量分布:一张不对称的地图
六语言文件逐一实测的题量分布如下(数据源:hf-mirror resolve 端点下载 test/{lang}.json 后逐条计数,2026-09-30 抓取):
| 语言 | 语言代码 | 题数(实测) | 占比 | 文件名 |
|---|---|---|---|---|
| 英语 | en | 7,327 | 34.4% | test/en.json |
| 中文 | zh | 8,759 | 41.1% | test/zh.json |
| 法语 | fr | 321 | 1.5% | test/fr.json |
| 西班牙语 | es | 2,742 | 12.9% | test/es.json |
| 阿拉伯语 | ar | 1,088 | 5.1% | test/ar.json |
| 印地语 | hi | 1,089 | 5.1% | test/hi.json |
| 合计 | — | 21,326 | 100% | — |
三重印证链:六文件求和 = 21,326 = HF 页面索引 “Number of rows: 21,326”,且 HF API size_categories: 10K<n<100K 相容。任何引用本基准的后续工作若给出其他总数,应先检查其统计口径(例如是否只统计了 test config 而遗漏 questions 形态,或是否使用了某个语言的旧版文件)。
体量不均是结构性事实而非缺陷:它忠实反映了各语言可用的题源存量。英语与中文拥有成熟的考试题生态(USMLE/印度 MCQ 传统/中国医学考试体系),西班牙语有 HEAD-QA 一家撑起,法语只有 FrenchMedMCQA 一份 321 题的翻译项目,阿拉伯语与印地语则完全依赖 MMLU 翻译。由此带来的直接后果是:跨语言平均分对比时,法语 321 题上的随机波动远大于英语 7,327 题——95% 置信区间半宽在法语上约 ±5 个百分点量级,在英语上约 ±1 个百分点量级。做语言间排名时,小于这一差距的差异不应过度解读。
§2.2 字段规格:四字段极简主义
每条记录四个字段,全部实测确认:
| 字段 | 类型 | 实测样例 | 说明 |
|---|---|---|---|
question |
string | “A lesion causing compression of the facial nerve at the stylomastoid foramen will…” | 题干原文,六语言各自书写 |
options |
string | “(A) paralysis of the facial muscles.\n(B) paralysis of the facial muscles and loss of taste.\n© …” | 换行分隔纯文本,非数组 |
answer |
string | “(A)” | 带括号的选项字母 |
source |
string | “medmcqa” | 上游来源标记(小写连字符格式) |
三个格式要点:
- options 是字符串不是数组。四选项以
\n分隔,每行以(A)(B)(C)(D)开头。消费代码需要options.split('\n')后逐行剥离(X)前缀。金标准库内其他 MCQA 数据集多用 options 数组,这是 XMedBench 的第一个格式陷阱(坑 2)。 - answer 带括号。答案是
"(A)"而非"A"或0——与模型输出的字符串匹配时,注意先做括号归一化,避免把"模型答对但格式不匹配"误判为答错。 - source 是自由字符串。实测出现的取值包括
medmcqa、mmlu-medical、medqa-usmle(英语切片)与medqa-mcmle、cmb-single、cmexam、cmmlu-medical(中文切片);其余四语切片亦已实测——fr 全部为frenchmedmcqa、es 全部为headqa、ar 全部为mmlu-medical-ar、hi 全部为mmlu-medical-hi——全部为小写连字符格式。
§2.3 文件树与两种数据形态
HF 仓库文件树(hf-mirror API 实抓):
FreedomIntelligence/XMedbench/
├── XMedBench.zip # 整包(全部语言一次性下载)
├── questions/
│ ├── {lang}_question.json × 6 # 原始题目形态
│ └── ...
└── test/
├── en.json # 7,327 题
├── zh.json # 8,759 题
├── fr.json # 321 题
├── es.json # 2,742 题
├── ar.json # 1,088 题
└── hi.json # 1,089 题
两种形态的分工:test/ 是评测形态(HF 页面索引与 “Number of rows” 按 test config 展示 21,326 行);questions/ 是原始题目形态(文件名带 _question 后缀)。两者的字段差异未逐文件比对(FACTS 待核 3),但论文与 GitHub 的复现流水线(0.download_data.sh)以下载脚本统一拉取,普通使用者以 test/ 形态为准即可。
体积方面:整库 usedStorage 实测 33,383,744 字节(约 33.4 MB)——在动辄数十 GB 的医疗数据集里近乎轻量,这是它作为评测基准的工程美德:一次下载、内存可载、无预处理门槛。
§2.4 语言切片的 source 分布:实测数字
英语与中文两个大切片的 source 分布已逐条实测:
英语(7,327 题):
| source | 题数 | 占比 | 上游全称 |
|---|---|---|---|
medmcqa |
4,183 | 57.1% | MedMCQA(印度 AIIMS/NEET-PG 医学考试题) |
mmlu-medical |
1,871 | 25.5% | MMLU 医学相关 6 子类 |
medqa-usmle |
1,273 | 17.4% | MedQA-USMLE 4-options 版 |
| 合计 | 7,327 | 100% | — |
中文(8,759 题):
| source | 题数 | 占比 | 上游全称 |
|---|---|---|---|
medqa-mcmle |
3,426 | 39.1% | MedQA-MCMLE(USMLE 中文移植版) |
cmb-single |
2,000 | 22.8% | CMB 单选题(随机抽样 2,000) |
cmexam |
2,000 | 22.8% | CMExam(随机抽样 2,000) |
cmmlu-medical |
1,333 | 15.2% | CMMLU 医学相关 7 子目录 |
| 合计 | 8,759 | 100% | — |
这张表藏着两个使用要点。其一,英语切片近六成来自 MedMCQA——一个以印度医学执业考试为源、题目难度分布偏记忆型的题库(坑 7 详述其对分数解读的影响)。其二,中文切片的 cmb-single 与 cmexam 各恰为 2,000 题——这不是巧合,而是 GitHub README 明文记录的随机抽样:“(not used, randomly sample 2000)”。这四个字是全基准最大的语义陷阱之一,坑 5 与 §3.3 专述。
§2.5 六语言构成的完整图景
综合论文 Appendix B.1(ar5iv v6 全文实抓)、GitHub README 与本地实测,21,326 题的完整构成如下:
| 语言 | 题源 | 题数 | 题源性质 |
|---|---|---|---|
| 英语 | MedQA-USMLE(4-options) | 1,273 | 原生考试题(美国执业医师考试) |
| 英语 | MedMCQA | 4,183 | 原生考试题(印度 AIIMS/NEET-PG) |
| 英语 | MMLU 医学 6 子类 | 1,871 | 原生考试题(跨学科知识测试) |
| 中文 | MedQA-MCMLE | 3,426 | 移植+本地化考试题 |
| 中文 | CMMLU 医学 7 子目录 | 1,333 | 原生考试题(中国教育考试生态) |
| 中文 | CMB-single(抽样 2,000) | 2,000 | 原生考试题(中国医学基准) |
| 中文 | CMExam(抽样 2,000) | 2,000 | 原生考试题(中国执业医师考试) |
| 西班牙语 | HEAD-QA | 2,742 | 原生考试题(西班牙医疗系统 PIR 考试等) |
| 法语 | FrenchMedMCQA | 321 | 法语移植题(源为英/法语医学资源) |
| 阿拉伯语 | MMLU 医学部分翻译版 | 1,088 | 翻译题(论文自认妥协) |
| 印地语 | MMLU 医学部分翻译版 | 1,089 | 翻译题(论文自认妥协) |
六个子类的 MMLU 医学选择清单(跟随 Med-PaLM2,Singhal et al. 2023):Clinical knowledge、Medical genetics、Anatomy、Professional medicine、College biology、College medicine。CMMLU 的 7 个子目录清单:Anatomy、Clinical knowledge(临床知识)、College medicine(大学医学)、Genetics(遗传学)、Nutrition(营养学)、Traditional Chinese Medicine(中医)、Virology(病毒学)——注意中医子目录是中国考试生态独有的知识域,任何英语基准里都不存在对应物。
§2.6 题干长度实测:六语言的形态学
六个语言文件逐一实测的题干字符长度统计(len(question),2026-09-30 本地计算):
| 语言 | 题数 | 均值 | 中位数 | P90 | 最长 |
|---|---|---|---|---|---|
| en | 7,327 | 230 | 85 | 718 | 4,671 |
| zh | 8,759 | 34 | 18 | 87 | 277 |
| fr | 321 | 114 | 105 | 163 | 359 |
| es | 2,742 | 144 | 98 | 310 | 1,351 |
| ar | 1,088 | 97 | 54 | 246 | 1,315 |
| hi | 1,089 | 232 | 92 | 635 | 2,612 |
四个读表要点:
- 跨语言比较字符长度没有意义。汉字的信息密度约为拉丁字母的三倍量级,zh 的"均值 34 字符"与 en 的"均值 230 字符"并不代表中文题更简单——这是文字系统差异,不是难度差异。做长度相关分析时应在语言内部比较,或先统一到 token 计数。
- 英语分布是双峰的:中位 85 vs 均值 230、P90 高达 718、最长 4,671 字符——短峰是 MedMCQA 的记忆型短题干,长尾是 MedQA-USMLE 的临床案例长题干(§2.4 的 source 构成决定了这个形态)。最长的 4,671 字符约合 1,100+ token,做评测时注意上下文预算与截断策略。
- 中文题干极短(中位 18 字符):MCMLE 风格的短题干意味着题目往往依赖题干末尾的提问方式与选项补全——中文切片的信息重心在选项里,做检索或向量化时不能只索引题干。
- 阿/印地语的长尾来自翻译膨胀:MMLU 原题翻译成印地语后平均长度(232)接近英语水平,但最长 2,612 字符的长尾反映部分题目译文冗长(印地语对英语术语的音译展开)——翻译件不仅在术语上有风险(§3.5),在长度上也与原生考题形态不同。
§3 任务设计与上游溯源
§3.1 任务定义:四选项单选,仅此一种
XMedBench 的任务空间刻意收窄:全部 21,326 题均为四选项单选题,没有多选、没有排序、没有匹配、没有开放问答。这个设计决定有三个动因:
- 判分零歧义。四选项单选的正确答案唯一且机器可判(字符串匹配
(A)-(D)),不依赖人工评分或 LLM-as-judge——这在多语言场景尤为关键:六语言的评判员模型本身能力不均,回避开放题等于回避评判员偏差。 - 跟随 Med-PaLM2 传统。论文明确按 Med-PaLM2(Singhal et al. 2023)的方法选择 MMLU 医学子类并采用 4-options 版本的 MedQA(原版 MedQA 含 5-options 变体,此处统一取 4-options)。
- 跨语言同构。统一的题型使六语言的分数严格可比——同一模型在六语言上的准确率差异可以归因于语言与题源,而不是任务格式。
代价同样明确:它测不了长文本临床推理、多轮对话、医患沟通等真实场景能力。XMedBench 度量的是"六语言下的医学知识掌握度",这个定位之内它是严谨的,超出定位的使用(如宣称"XMedBench 高分 = 会看病")是误用。
§3.2 八个上游题源的逐一点名
MedQA-USMLE(英语 1,273 题):源自美国执业医师资格考试(USMLE)真题风格的题库(Zhang et al. 2018),临床案例导向的长题干。XMedBench 取其 4-options 版本。英语切片中临床推理密度最高的部分。
MedMCQA(英语 4,183 题):印度医学入学考试(AIIMS、NEET-PG)题库(Pal et al. 2022),覆盖基础医学与临床医学的广谱知识点,题干短、记忆型比重大。英语切片的最大单一来源(57.1%)。
MMLU 医学 6 子类(英语 1,871 题):Hendrycks et al. 2020 的 MMLU 中与医学相关的六个子类(清单见 §2.5)。选取清单跟随 Med-PaLM2 论文——这是从通用知识基准里切出的医疗面,难度梯度从大学基础(College biology)到职业考试(Professional medicine)。
MedQA-MCMLE(中文 3,426 题):MedQA 的中文移植版,对应中国医师资格考试(MCMLE)风格。它是 MedQA-USMLE 的姊妹题库——同一项目组维护、同一题型格式,这使得英语-中文的 MedQA 子集在题型上严格可比。
CMMLU 医学 7 子目录(中文 1,333 题):Li et al. 2023a 的中文本土知识测评中与医学相关的七个子目录。与 MMLU 的关系类似但不对称:CMMLU 完全为中国教育生态原生出题,含 MMLU 没有的传统中医子目录。
CMB-single(中文 2,000 题):CMB(Chinese Medical Benchmark)的单选题部分,随机抽样 2,000 题纳入。README 标注 “(not used, randomly sample 2000)”——语义见 §3.3。
CMExam(中文 2,000 题):中国执业医师考试题库,同样随机抽样 2,000 题纳入,同样标注 “(not used, randomly sample 2000)”。
HEAD-QA(西班牙语 2,742 题):西班牙医疗系统专科准入考试(MIR 医学、PIR 心理学、EIR 护理、FIR 药学、BIR 生物学、QUIR 化学六类)题库(Vilares and Gómez-Rodríguez 2019),XMedBench 的西班牙语切片即其全部或主体(2,742 题)。
FrenchMedMCQA(法语 321 题):Labrak et al. 2023a 的法语医学 MCQA 集。实际 HF repo 为 qanastek/frenchmedmcqa(qanastek = 一作 Yanis Labrak)——不在 FreedomIntelligence 名下,论文/README/真实 repo 三处名称各有一字之差(坑 6)。
MMLU 翻译版(阿拉伯语 1,088 题 + 印地语 1,089 题):FreedomIntelligence 自行维护的 MMLU_Arabic 与 MMLU_Hindi 翻译数据集(2023 年 8 月创建,MIT 许可),从中取医学相关部分。论文脚注给出链接,GitHub README 里两行链接互换(坑 3 详述)。
§3.3 “not used” 之谜:论文实验与发布基准的口径差
GitHub README 的中文数据行写着:CMB-single (not used, randomly sample 2000)、CExam (not used, randomly sample 2000)。两个 “(not used)” 极易被读成"这两个题源没有包含在基准里"——但实测恰好相反:test/zh.json 中 cmb-single 恰 2,000 条、cmexam 恰 2,000 条,全部在场。
正确的读法是:“not used” 指"未用于论文主表的实验",而非"未包含在发布基准中"。换言之,这 4,000 题(占中文切片 45.7%)在发布版基准里可评测,但论文正文 Table 3 的中文分数(MCMLE/CMMLU 两列)只对应其中约 4,759 题(medqa-mcmle 3,426 + cmmlu-medical 1,333)。复现论文实验或对比论文数字时,应只取 medqa-mcmle 与 cmmlu-medical 两个 source 的题;做全基准评测时则用全部 8,759 题——两种口径的分数不可混用。此点在坑 5 与 §4.5 展开。
§3.4 官方 Prompt 模板:六语言同一张卷面
论文 Figure 3 给定的评测模板(ar5iv v6 实抓原文):
User:
You are a medical doctor answering real-world medical exam questions.
Select one correct answer from A to D.
Question: {question}
Options: (A) {option_a} (B) {option_b} (C) {option_c} (D) {option_d}
Assistant:
The correct answer is {answer}. <special_token>
四个值得注意的细节:
- 模板本身是英语的。即便评测阿拉伯语或印地语的题目,指令段仍以英语书写(题目与选项替换为对应语言文本)。这是多语言评测的常见做法——指令语言统一后,模型不需要先判断"这是哪国卷子"——但也意味着模型的跨语言指令跟随能力被前置耦合进了分数。
- 角色扮演前置。“You are a medical doctor” 的角色设定使分数对模型的角色遵循能力敏感。
- 答案格式固定。“The correct answer is {answer}.” 使输出解析可以用简单字符串匹配,无需 LLM 判卷。
<special_token>结尾。这是训练侧的序列标记,纯推理复现时通常不必要,但对照论文数字时注意训练与评测的 token 序列差异。
§3.5 阿拉伯语与印地语:一纸翻译件的分量
论文对阿/印地语切片的自我定位极为坦率:“For Hindi and Arabic, which lack local assessments, we make a compromise by applying translated versions of MMLU.”(对缺乏本地医学考试评估的印地语与阿拉伯语,我们妥协地采用 MMLU 的翻译版本。)
这段"妥协"的实际含义:
- 题源:MMLU 医学 6 子类的题目,经 FreedomIntelligence 翻译为阿拉伯语与印地语(对应翻译数据集
FreedomIntelligence/MMLU_Arabic与FreedomIntelligence/MMLU_Hindi,2023-08 创建于 HF,MIT 许可)。 - 质量含义:翻译题存在三重风险——医学术语在目标语言中的标准译名未必唯一(如印地语的解剖学名词有梵语源与英语音译两套系统)、题目背景(美国医疗体系、美国药名)的文化错位、以及翻译腔对阅读流畅度的影响。母语出题的医学考试题不存在这些问题。
- 分数解读:模型在阿/印地语切片上的低分(如 Llama-2-70B 的阿拉伯语 MMLU 仅 1.65%,见 §4.2)混合了"医学知识不足"与"翻译文本理解困难"两种误差源,不能直接归因于前者。
一个反向的佐证是:GPT-4 在阿拉伯语 MMLU 上仍能拿到 56.43%、在印地语 MMLU 上 62.17%——顶级模型的翻译鲁棒性部分吸收了妥协的成本,但开源小模型在低资源语言上的崩塌依然是 XMedBench 最刺眼的数据景观(§4.2)。
§3.6 难度构成学:没有难度标注的基准怎么读难度
XMedBench 没有任何官方难度标注、分层元数据或题型标签——每条记录只有四个字段,难度信息只能从题源构成间接推断。这本身是元数据质量(DAIMS 维度 M)的一个失分点,但逆向工程是可行的:
- 英语内部的三档难度定位。MedMCQA 子集(4,183 题):短题干、记忆型、覆盖基础与临床广谱知识点——"知识回忆"型难度;MMLU 医学 6 子类(1,871 题):从 College biology/medicine 的大学基础到 Professional medicine 的职业考试——"通识到职业"的梯度;MedQA-USMLE 子集(1,273 题):长临床案例、鉴别诊断导向——"临床推理"型难度。三者构成一个粗粒度的难度光谱,§2.6 的题干长度双峰就是这个光谱的形态学投影。
- 中文的四源构成。MCMLE(3,426 题,短题干应试型)、CMMLU(1,333 题,含中医等本土知识域)、CMB-single(2,000 题,五选项单选)、CMExam(2,000 题,含多选)——中文切片的难度光谱比英语更杂,且混入了题型差异(§2.4 交叉表)。
- 法语的模式单一性。FrenchMedMCQA 的题干多为 “Parmi les propositions suivantes, indiquer celle qui est exacte”(下列陈述中选出正确者)式的固定句式——题源单一使法语列的分数对这类"陈述判别"题型过拟合,跨语言解读时注意这个题型偏置。
- 西语的单题源广覆盖。HEAD-QA 一家撑起 2,742 题,专业方向横跨药学、心理学、护理、医学——单一考试体系的内部多样性,与英语的三源混合是两种不同的广度。
- 实践含义。做难度分层评测(easy/medium/hard)时,可用"题源 + 题干长度"做代理分层,但必须在报告里声明这是代理而非官方标注;做抗污染分析时,MedMCQA 与 CMB/CMExam 因其在训练生态中的高曝光率,应视为高污染风险子集(坑 8 的子集级细化)。
§4 评估体系与主结果
§4.1 主表布局:九列分数,一个平均
论文 v6 主结果表(Table 3)按"语言 × 题源"展开九个评测列,外加平均分:
| 语言 | 评测列 |
|---|---|
| 英语 | USMLE(MedQA-USMLE)/ MedMCQA / MMLU◇ |
| 中文 | MCMLE(MedQA-MCMLE)/ CMMLU◇ |
| 法语 | FrenchMedMCQA |
| 西班牙语 | HEAD-QA |
| 阿拉伯语 | MMLU◇(翻译版) |
| 印地语 | MMLU◇(翻译版) |
◇ 符号(论文表头记为 ♢)表示"医学相关部分切片"——即 MMLU/CMMLU 只取医学子类而非全量。这张表是 XMedBench 的成绩单封面:闭源模型(GPT-4/GPT-3.5)、开源大模型(70B 级)、开源小模型(7B-14B 级)与 Apollo 系列五行排开,同卷同判。
§4.2 主结果全景(v6 实录)
论文 Table 3 关键行的平均分与代表性分项(v6 HTML 全文实抓;分项顺序:USMLE / MedMCQA / MMLU◇ / MCMLE / CMMLU◇ / FrenchMedMCQA / HEAD-QA / MMLU-Ar◇ / MMLU-Hi◇):
闭源模型:
| 模型 | USMLE | MedMCQA | MMLU◇ | MCMLE | CMMLU◇ | FrenchMCQA | HEAD-QA | MMLU-Ar◇ | MMLU-Hi◇ | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| GPT-4 | 79.10 | 70.40 | 86.00 | 65.72 | 65.72 | 89.72 | 85.05 | 56.43 | 62.17 | 73.37 |
| GPT-3.5 | 61.98 | 56.51 | 72.94 | 58.73 | 50.41 | 68.54 | 71.48 | 39.70 | 39.94 | 57.80 |
开源 ≥70B:
| 模型 | USMLE | MedMCQA | MMLU◇ | MCMLE | CMMLU◇ | FrenchMCQA | HEAD-QA | MMLU-Ar◇ | MMLU-Hi◇ | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen-72B | 64.10 | 62.16 | 78.46 | 91.68 | 81.47 | 74.14 | 76.62 | 46.87 | 43.16 | 68.74 |
| Meditron-70B | 55.70 | 50.87 | 69.59 | 48.34 | 40.29 | 53.27 | 59.74 | 19.30 | 31.31 | 47.60 |
| Llama-2-70B | 32.99 | 48.29 | 64.62 | 25.80 | 25.13 | 50.47 | 54.34 | 1.65 | 26.35 | 36.63 |
Apollo 系列(本文主角):
| 模型 | USMLE | MedMCQA | MMLU◇ | MCMLE | CMMLU◇ | FrenchMCQA | HEAD-QA | MMLU-Ar◇ | MMLU-Hi◇ | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| Apollo-0.5B | 32.99 | 37.82 | 45.87 | 56.57 | 42.08 | 27.41 | 36.67 | 31.89 | 25.90 | 37.47 |
| Apollo-1.8B | 42.18 | 44.99 | 49.12 | 72.30 | 53.56 | 38.01 | 42.15 | 34.74 | 25.62 | 44.74 |
| Apollo-2B | 38.33 | 42.00 | 52.89 | 46.76 | 36.76 | 38.32 | 41.28 | 31.62 | 31.50 | 39.94 |
| Apollo-6B | 56.25 | 57.53 | 68.65 | 85.52 | 72.62 | 51.71 | 58.47 | 33.46 | 33.61 | 57.54 |
| Apollo-7B | 56.00 | 58.21 | 71.86 | 72.36 | 59.04 | 60.44 | 63.73 | 41.82 | 45.55 | 58.78 |
同级开源对照组(7B-34B):
| 模型 | Avg | 备注 |
|---|---|---|
| Qwen-14B | 52.67 | 通用多语言底座 |
| Gemma-7B | 52.44 | Apollo 训练底座之一 |
| MMedLM2-7B | 51.45 | 医疗继续预训练模型 |
| Yi-34B | 47.00 | 通用底座 |
| PMC-Llama-7B | 16.10 | 医疗继续预训练模型(低资源语言崩塌典型) |
五个读表要点:
- Apollo-7B(58.78%)超过同级的 Gemma-7B(52.44%)、MMedLM2-7B(51.45%)约 6-7 个百分点,也超过 14B 的 Qwen(52.67%)与 34B 的 Yi(47.00%)——这是"≤70B 开源 SOTA"宣称的证据链。
- 中文是开源模型的相对强项:Qwen-72B 的 MCMLE 高达 91.68%(全表最高单项),反映其训练分布对中文考试生态的覆盖。GPT-4 在 MCMLE/CMMLU 上(65.72/65.72)反而不及 Qwen-72B——闭源模型在中文考试题上的优势并不普遍。
- 低资源语言是开源模型的坟场:Llama-2-70B 的阿拉伯语 MMLU◇ 仅 1.65%(低于随机猜测 25%——这不是知识不足,而是指令跟随/格式输出在阿拉伯语上的崩溃),PMC-Llama-7B 的平均 16.10% 同理。Apollo 系列经多语训练后把同尺寸低资源分数拉回到 25-45% 区间——这正是论文的核心卖点。
- Apollo-2B(39.94%)低于 Apollo-1.8B(44.74%):非单调的 scaling 在小尺寸医疗模型上真实存在,选用时不能默认"更大更好"。
- GPT-4 与开源最强的差距在 14-15 个百分点(73.37 vs Qwen-72B 68.74 或 Apollo-7B 58.78),且差距在高资源语言上小(法语 89.72 vs 74.14)、在低资源语言上大(阿拉伯语 56.43 vs 46.87)——低资源语言的医疗能力差距比英语更大。
§4.3 训练策略消融:多语联合训练为什么赢
论文 Table 1 的试点研究(以 Qwen-1.8B 为基座)回答了一个关键方法学问题:六种语言应该分开训练六个单语模型,还是混在一起训一个多语模型?
| 训练策略 | en | zh | fr | es | ar | hi | Avg |
|---|---|---|---|---|---|---|---|
| 基座 Qwen-1.8B | 32.91 | 40.07 | 22.12 | 27.43 | 23.71 | 8.82 | 25.84 |
| Apollo-English(单语) | 39.44 | 45.27 | 28.35 | 31.76 | 22.61 | 8.72 | 29.36 |
| Apollo-Chinese(单语) | 39.42 | 61.13 | 28.97 | 33.83 | 27.94 | 25.34 | 36.11 |
| Apollo-French(单语) | 30.94 | 32.71 | 23.81 | 27.00 | 24.54 | 1.74 | 23.46 |
| Apollo-Spanish(单语) | 33.84 | 43.81 | 27.41 | 35.39 | 28.40 | 23.88 | 32.12 |
| Apollo-Arabic(单语) | 36.40 | 44.27 | 3.74 | 15.73 | 25.90 | 3.03 | 21.85 |
| Apollo-Hindi(单语) | 25.18 | 3.45 | 18.38 | 19.69 | 1.00 | 25.53 | 15.54 |
| weight average(权重平均) | 40.54 | 45.58 | 28.04 | 34.08 | 28.95 | 24.06 | 33.54 |
| 多语联合训练(Apollo-1.8B) | 45.43 | 62.93 | 38.01 | 42.15 | 34.74 | 25.62 | 41.48 |
结论一目了然:多语联合训练(41.48)比最好的单语模型(Chinese 36.11)高 5.4 分,比基座高 15.6 分。且单语模型存在严重的跨语言互伤(Apollo-Hindi 训练后英语掉到 25.18、阿拉伯语模型把法语拉到 3.74)——低资源语言的梯度会把模型拖向灾难性遗忘。权重平均(weight average)是廉价的折中(33.54),但仍不敌联合训练。这张表是"低资源语言不该单独训模型"这一经验在医疗领域的定量证据。
§4.4 proxy-tuning:小模型的另类用法
Apollo 论文的第二贡献是 proxy-tuning——免训练地把 Apollo 的医疗能力"注入"更大的通用模型:
- 公式(BearPlex 第三方整理口径):
output = larger_general_model + (Apollo_tuned − Apollo_base) - 论文口径:“these lite models could be used to improve the multi-lingual medical capabilities of larger models without fine-tuning in a proxy-tuning fashion”(这些小模型可以在不做微调的情况下,以 proxy-tuning 方式提升大模型的多语医疗能力)
- 语义:把"Apollo 微调前后在同一点上的输出分布差"(医疗方向的梯度)叠加到任意大模型上,效果近似"给大模型戴上医疗眼镜"而不动其权重。
对 XMedBench 使用者的意义:如果想复现论文的完整结果矩阵,除了五个 Apollo 尺寸模型本身,还可关注论文中 proxy-tuning 应用于大模型后的分数列——这些列展示了"7B 医疗模型 + 70B 通用模型"的组合如何逼近专用 70B 医疗模型的成绩。
§4.5 复现口径三则
- 中文分数的口径。论文 Table 3 的中文两列对应 MCMLE + CMMLU◇ 两个题源(实测 3,426 + 1,333 = 4,759 题)。若把 8,759 题全量跑分再与论文数字对表,中文分会因混入 cmb-single/cmexam 4,000 题(论文未实验)而不可比(坑 5)。
- 法语 321 题的方差。法语列是九列中方差最大的一列,模型间 1-3 分的差异无统计意义(§2.1)。
- 评测底座差异。论文中 Apollo-7B 基于 Gemma-7B 继续训练(GitHub 流水线脚本名为 3.single_node_train_gemma.sh),而对比组 Gemma-7B 原版也在表内——同底座直比的组内对照(58.78 vs 52.44)比跨底座对照更有说服力。
§4.6 读榜实操:从 Table 3 衍生的三张视图
主表九列分数直接读容易迷失,三张衍生视图把信息密度提上来(全部数字由 §4.2 主表原位计算,无外部来源):
**视图一:语言落差榜(闭源 vs 开源在两种语言带上的差距)。**把九列分成"高资源语言带"(USMLE/MedMCQA/MMLU◇/MCMLE/CMMLU◇/FrenchMCQA/HEAD-QA)与"低资源语言带"(MMLU-Ar◇/MMLU-Hi◇),计算各自平均:
| 模型 | 高资源带均值(7 列) | 低资源带均值(2 列) | 落差 |
|---|---|---|---|
| GPT-4 | 77.53 | 59.30 | 18.2 |
| Qwen-72B | 71.18 | 45.02 | 26.2 |
| Apollo-7B | 62.54 | 43.69 | 18.9 |
| Llama-2-70B | 44.77 | 14.00 | 30.8 |
GPT-4 的落差(18.2)与 Apollo-7B(18.9)几乎相同——顶级闭源与最好的开源小模型在"低资源税"上支付了相似的比例;而 Llama-2-70B 的 30.8 落差与其阿语 1.65% 的崩塌一致:低资源税不是按模型规模线性收取的,训练数据的多语覆盖才是决定变量。
**视图二:同底座对照组。**Apollo-7B 由 Gemma-7B 继续训练而来,两者同表对照:58.78 vs 52.44(+6.34);分列看,增益集中在中文(MCMLE 72.36 vs ?原版 Gemma 未入中文前列)与低资源语言(阿语 41.82 vs 基座的低位),而法语等高资源列的增益相对温和——医疗继续预训练的边际收益在"底座本来弱"的语言上最大。同类对照还有 MMedLM2-7B(51.45,同为 7B 级医疗继续预训练路线)落后 Apollo-7B 7.33 分——同为医疗赛道,多语语料配比与训练配方拉开的差距清晰可见。
**视图三:规模-性能非单调警示录。**两条非单调证据:Apollo 家族内部 2B(39.94)< 1.8B(44.74)——同门之内更大的尺寸反而更低;跨家族 Yi-34B(47.00)< Qwen-14B(52.67)——更大的通用底座输给更小的多语底座。两条共同指向:在多语医疗评测里,"底座的语言覆盖 × 训练配方的多语均衡"比参数量更早成为瓶颈。选型时把非单调性当作先验,不要用参数量外推分数。
§5 与 ApolloCorpus 的姊妹关系:训练与评测的一对
§5.1 三件套的分工
Apollo 论文同时发布三件资产,XMedBench 是其中的评测件:
| 资产 | 角色 | 体量 | 关键数字 |
|---|---|---|---|
| ApolloCorpora | 训练语料(继续预训练 + 指令微调) | 2.5B tokens | 十大类构成(见 §5.2) |
| Apollo 模型 | 被评测对象(5 个尺寸) | 0.5B/1.8B/2B/6B/7B | Apollo-7B 平均 58.78%(≤70B SOTA) |
| XMedBench | 评测基准 | 21,326 题 | 六语言,Apache-2.0 |
三者共享同一套研究叙事:用多语种语料训练小模型,在多语种基准上证明小模型逼近大模型——XMedBench 是这个叙事的裁判席。
§5.2 ApolloCorpora 的 token 账本(互链背景)
论文 Table 2 给出的 ApolloCorpora 十大类构成(供理解 XMedBench 的上游语境;详细分析见库内 ApolloCorpus 条目):
| 数据源大类 | 训练阶段 | 语言构成(# tokens) | 小计 |
|---|---|---|---|
| Books(书籍) | 继续预训练 | EN 296.7M, ZH 117.1M | 413.8M |
| Papers(论文) | 继续预训练 | ZH 45.6M, EN 252.9M, ES 46.0M, FR 4.5M | 349.0M |
| Encyclopedias(百科) | 继续预训练 | EN 221.1M, FR 4.6M, HI 0.5M | 226.2M |
| Dialogues(对话) | 继续预训练 | EN 92.1M, ZH 46.6M, AR 10.4M | 149.1M |
| Exams(考试) | 指令微调 | EN 42.1M, ZH 35.3M, FR 0.1M, ES 0.5M | 78.0M |
| Guidelines(临床指南) | 继续预训练 | EN 29.6M | 29.6M |
| Web(网页) | 继续预训练 | EN 499.9M, ZH 329.3M, ES 57.5M | 886.7M |
| General IT(通用指令) | 指令微调 | EN 194.5M, ZH 69.4M, HI 43.9M, FR 20.0M, AR 18.7M, ES 18.4M | 364.9M |
| Math(数学) | 指令微调 | EN 18.9M, ZH 3.7M | 22.6M |
| Code(代码) | 指令微调 | EN 9.2M, ZH 7.2M | 16.4M |
两个与 XMedBench 直接相关的观察:
- Exams 类(78.0M tokens)与 XMedBench 同源不同用:训练用的考试题与评测用的考试题都来自医学考试生态,但训练集不含 XMedBench 的测试题本身(标准的数据隔离)。不过 README 声明 PubMedQA、CMB-single、CExam 等"未用于论文"的题源在训练/评测间的确切隔离边界,论文未给出逐题清单——严格的数据污染审计是开放的(§10 坑 8)。
- 语言覆盖错位:ApolloCorpora 的 Books/Papers/Web 等主要类目只有 EN/ZH/ES/FR 四语(阿/印地语只出现在 Dialogues 与 General IT),而 XMedBench 强行覆盖六语——训练语料的语言失衡是阿/印地语分数天花板偏低的又一结构性原因。
§5.3 时间线上的三件套
GitHub README 的官方时间线(实抓):
- [2024.01.23] Apollo repo 发布(代码先行)
- [2024.02.12] ApolloCorpus 和 XMedBench 发布(两份数据同日公告)
- [2024.03.07] Paper 发布(arXiv:2403.03640 v1 于 2024-03-06 提交,README 记 03-07)
- [2024.04.25] MedJamba 发布(Mamba 架构的医疗变体)
- [2024.10.15] ApolloMoE 发布(扩展至 50 语言——注意其评测不再限于 XMedBench 六语)
HF 数据集的时间戳(hf-mirror API 实抓):createdAt 2024-03-06T13:07:39Z(与论文 v1 提交同日)、lastModified 2025-02-15T18:06:24Z。发布日存在双口径:GitHub 公告日 2024-02-12 vs HF 上架日 2024-03-06——成稿两说并存,引用时注明口径(FACTS 存照①;官方时间线全文见 §7.1)。
§6 获取与许可:一张 Apache-2.0 的入场券
§6.1 获取路径:公开直链,零门槛
XMedBench 的可获取性是教科书级的:HuggingFace 数据集页 FreedomIntelligence/XMedbench,gated=false、private=false,无需登录、无需申请、无需签协议。整库 19 个文件、约 33.4 MB,一次下载即可完整持有。
三条获取路径:
| 路径 | 适用场景 | 要点 |
|---|---|---|
| HF 原站 resolve 直链 | 海外网络 | https://huggingface.co/datasets/FreedomIntelligence/XMedbench/resolve/main/test/{lang}.json |
| hf-mirror 镜像 resolve 直链 | 大陆网络 | 域名换成 hf-mirror.com,路径不变;必须加 -L 跟随重定向(坑 4) |
huggingface-cli / datasets 库 |
程序化批量 | 一条命令整库落地,自动处理认证与缓存 |
最常用的镜像直链下载命令(六语言逐一):
# 单文件直链(hf-mirror 镜像;-L 必需——resolve 端点先 302 到 CDN)
for lang in en zh fr es ar hi; do
curl -L -o "test_${lang}.json" \
"https://hf-mirror.com/datasets/FreedomIntelligence/XMedbench/resolve/main/test/${lang}.json"
done
# 整库一次拉取(推荐,含 questions/ 与 XMedBench.zip)
huggingface-cli download FreedomIntelligence/XMedbench \
--repo-type dataset --local-dir xmedbench
两个实测教训值得记录:
- 不带
-L会拿到 78 字节的 “Temporary Redirect”。hf-mirror 与 HF 的 resolve 端点都先返回 302 到 CDN,curl默认不跟随——下载到的"JSON"实为一段重定向说明文本。这是本条目写作过程中真实踩到的坑(坑 4),curl -L或wget(默认跟随)可规避。 - repo id 大小写敏感。API 端点用
FreedomIntelligence/XMedBench(B 大写)请求会得到 302 重定向到XMedbench(b 小写)——说明 HF 内部规范 id 是小写 b。多数 HTTP 客户端会自动跟随这个重定向,但某些对大小写敏感的检索器、CI 缓存键或镜像同步任务可能因此漏检(坑 1)。
§6.2 加载方式:四种官方支持的姿势
HF 数据集 tags 实录显示四个官方支持的库:library:datasets、library:pandas、library:mlcroissant、library:polars。四种姿势的代码骨架:
# 姿势一:HF datasets(自动缓存、支持流式)
from datasets import load_dataset
ds = load_dataset("FreedomIntelligence/XMedbench", "test")
# split 名不是 "en/zh/...",而是:
# english / chinese / french / spanish / arabic / Hindi
# 注意 "Hindi" 独大写(其余全小写)——大小写敏感的代码会 KeyError(坑 1 的另一面)
# 姿势二:pandas(直接读本地 JSON 文件)
import pandas as pd
df = pd.read_json("test/zh.json")
# 四列:question / options / answer / source
# 姿势三:polars(大文件场景更快,本库 33 MB 感知不明显)
import polars as pl
df = pl.read_json("test/en.json")
# 姿势四:mlcroissant(机器可读元数据层,HF 自动生成)
# Croissant 元数据描述了 RecordSet 与字段分布,适合数据编目系统自动摄入
无论哪种姿势,拿到手后第一件事是解析 options 字段——它是换行分隔的纯文本字符串而非数组(坑 2,§10.1 详述)。一段健壮的解析骨架:
def parse_options(options_str: str) -> list[str]:
"""'(A) xx\n(B) yy\n(C) zz\n(D) ww' -> [('A','xx'), ..., ('D','ww')]"""
out = []
for line in options_str.split("\n"):
line = line.strip()
if not line:
continue
prefix, text = line.split(")", 1) # '(A' + ') xx' 的拆法对多字母也成立
out.append((prefix.strip("("), text.strip()))
return out
一个谨慎提醒:中文切片存在 5 选项题(3,927 条)与多字母组合答案(62 条,(AB)/(ABC) 式)——上面这段骨架在 answer 归一化时也要兼容多字母("(AB)" -> "AB"),否则会把合法多选题判为解析失败(§10.1 坑 2 与 FACTS 存照⑦)。
§6.3 文件清单与体量账本
HF API siblings 字段实录的全部 19 个文件:
| 文件 | 类型 | 内容 |
|---|---|---|
README.md |
文档 | 数据卡(构成表、时间线、引用块) |
.gitattributes |
元数据 | Git LFS 配置 |
XMedBench.zip |
数据 | 整包(全部语言一次性下载) |
assets/Medbase.png |
图片 | Medbase 相关素材(与 XMedBench 的确切关系未深究,FACTS 待核 3) |
assets/XMedBench.png |
图片 | 基准示意图 |
assets/apollo_medium_final.png |
图片 | Apollo 中型模型素材 |
assets/result.png |
图片 | 主结果图 |
questions/{ar,en,es,fr,hi,zh}_question.json × 6 |
数据 | 原始题目形态(纯题干字符串列表,无选项无答案) |
test/{ar,en,es,fr,hi,zh}.json × 6 |
数据 | 评测形态(四字段,带答案) |
体量账本:HF API usedStorage 实测 33,383,744 字节 ≈ 33.4 MB(十进制)。在医疗数据集家族里这是轻量级的极端——MIMIC-IV 动辄数十 GB、WSI 病理以 TB 计,而一份覆盖六语言的评测基准装进 33 MB,意味着:笔记本内存可整载(json.load 直接进 dict)、Git 可托管、邮件附件可传、离线环境可用。评测基准的"体积美德"与训练集的"规模美德"是两种不同的好。
test/ 与 questions/ 双形态的分工(§2.3 已述):评测用前者,自建开放式评测或自生成选项用后者。注意 questions/ 形态无标准答案,若用于自动化评测需自行准备答案键——官方流水线(GitHub FreedomIntelligence/Apollo 的 0.download_data.sh → 4.eval.sh)使用的是带答案形态。
§6.4 许可分层:主体宽松,上游各随其源
XMedBench 的许可是"一层主体 + 八个上游"的分层结构,逐层实录:
| 层 | 资产 | 许可 | 依据 |
|---|---|---|---|
| 主体 | XMedBench 汇编整体 | Apache-2.0 | HF cardData.license 与 tags 双证实抓 |
| 上游(翻译件) | FreedomIntelligence/MMLU_Arabic | MIT | 2023-08-06 创建,HF 卡片 |
| 上游(翻译件) | FreedomIntelligence/MMLU_Hindi | MIT | 同上 |
| 上游(英语题源) | MedQA-USMLE(GBaker/MedQA-USMLE-4-options) | MIT | 上游 HF 卡片 |
| 上游(英语题源) | MedMCQA | MIT | 上游 HF 卡片 |
| 上游(英语题源) | MMLU | MIT | 上游仓库 |
| 上游(中文题源) | MedQA-MCMLE(bigbio/med_qa 中文 4-options) | MIT | 上游 HF 卡片 |
| 上游(中文题源) | CMMLU | 单独协议(非标准开源许可) | 上游 HF 卡片需逐核 |
| 上游(中文题源) | CMB / CMExam | 各随其源 | 使用前逐核上游条款 |
| 上游(西语题源) | HEAD-QA | CC BY 4.0 | 上游 GitHub/HF |
| 上游(法语题源) | FrenchMedMCQA | MIT | 上游 HF 卡片 |
三层合规要点:
- Apache-2.0 只覆盖"汇编"这一层。它给了你使用、修改、再分发、商用、专利授权的完整自由——但这是对 FreedomIntelligence 做的整理与翻译工作的授权,不是对上游题目内容的授权。Apache-2.0 的 NOTICE 与再分发条款解决的是汇编层法律关系,上游题目的权利瑕疵不会因为汇编层宽松而消失。
- CC BY 4.0(HEAD-QA)的署名穿透。西语切片 2,742 题全部来自 HEAD-QA,CC BY 4.0 要求署名(引用 Vilares and Gómez-Rodríguez 2019)与修改标注。把 XMedBench 整包再分发时,CC BY 的署名义务随之传递——这不是 Apache-2.0 的 NOTICE 文件能替代的。
- CMMLU 的"单独协议"是唯一非标准项。CMMLU 未采用标准开源许可,再分发或商用场景需直接读其 HF 卡片条款(逐核原则)。好在其在 XMedBench 中只占中文切片的 1,333 题(15.2%),若合规评估受阻,可退而只使用其余题源。
工程上的一条实践建议:把上表原样写进你的数据使用登记(data provenance)文件——评测基准的许可审计成本本来就低,33 MB 的 JSON 做不到的事,不要指望换个基准就能做到。
§6.5 引用与署名:BibTeX 与作者数双口径
官方引用块(HF README 与 GitHub 一致,实抓):
@misc{wang2024apollo,
title={Apollo: Lightweight Multilingual Medical LLMs towards Democratizing Medical AI to 6B People},
author={Xidong Wang and Nuo Chen and Junyin Chen and Yan Hu and Yidong Wang and Xiangbo Wu and Anningzhe Gao and Xiang Wan and Haizhou Li and Benyou Wang},
year={2024},
eprint={2403.03640},
archivePrefix={arXiv},
primaryClass={cs.CL}
}
引用 BibTeX 时需知情的双口径(FACTS 存照③,§10.3 详列):BibTeX 列 10 位作者,而 arXiv 摘要页作者列表为 12 人(多出 Guorui Zhen、Chunxian Zhang)。两种口径都是官方的——BibTeX 是项目组自己维护的引用块,arXiv 页是出版平台的元数据。建议:论文引用按 BibTeX(官方口径),人物介绍或致谢按 arXiv 页并注明差异。
机构与人物速览(详见 FACTS 第 3 节):全部作者来自香港中文大学(深圳)与深圳大数据研究院体系;前三作者 Xidong Wang、Nuo Chen、Junyin Chen 同等贡献(论文脚注口径);通讯作者 Benyou Wang(王本友,wangbenyou@cuhk.edu.cn),BibTeX 尾位作者。项目主页 apollo.llmzoo.com,代码仓库 github.com/FreedomIntelligence/Apollo。
使用 XMedBench 而不引用 Apollo 论文是不合规矩的:基准的构成表、分数表、prompt 模板全部出自论文,BibTeX 是最小义务。
§6.6 计量数据与 AI-Ready 终评
抓取时点(2026-09-30)的 HF 实测计量:
| 指标 | 数值 | 解读 |
|---|---|---|
| downloads | 243 | 数据集页直下量,评测基准的影响不走这条渠道(§7.3) |
| likes | 14 | 社区标记量,与论文引用量不同源 |
| size_categories | 10K<n<100K | 与 21,326 相容 |
| tags | fr/en/es/zh/ar/hi + apache-2.0 + format:json + modality:text 等 | 语言、许可、格式三要素齐备 |
DAIMS 快评(全表与逐项拆解见 §10.2):可获取性(A)与可互操作性(I)是它的长板——直链、无门槛、JSON、四库支持;可发现性(D)被大小写三态拖累半分——XMedbench(repo id)/XMedBench(显示名)/XMedBench.zip(文件名)并存,检索者第一次搜索十有八九输错大小写(坑 1)。总体是"获取零摩擦、语义有小刺"的 AI-Ready 正面样本。
§6.7 数据完整性自检清单
拿到数据后的第一小时应该跑完这组自检(全部阈值来自本条目实测,任一不匹配即说明你拿到的不是当前版本):
[ ] 六个 test/{lang}.json 行数:en=7,327 zh=8,759 fr=321 es=2,742 ar=1,088 hi=1,089,合计 21,326
[ ] 每条记录恰有 4 个键:question / options / answer / source
[ ] source 取值集合:en∈{medmcqa, mmlu-medical, medqa-usmle}
zh∈{medqa-mcmle, cmb-single, cmexam, cmmlu-medical}
fr={frenchmedmcqa} es={headqa}
ar={mmlu-medical-ar} hi={mmlu-medical-hi}
[ ] en/es/ar/hi 全部 4 选项;fr 全部 5 选项;zh 为 4,832×4 + 3,927×5 混合
[ ] answer 格式:^\([A-E]{1,5}\)$;zh 允许多字母(62 条,全在 cmexam)
[ ] zh 的 source×题数:medqa-mcmle=3,426 cmb-single=2,000 cmexam=2,000 cmmlu-medical=1,333
[ ] questions/*_question.json 为字符串列表(无选项无答案),长度与对应 test 文件一致(6 组各自核对)
[ ] 文件编码 UTF-8;fr/es 含重音字符、ar 为 RTL 文本、hi 为天城文——管道中避免任何隐式 ASCII 化
清单的前六项是数据本体校验,后两项是工程环境校验。RTL 与天城文是医疗数据管线里最常翻车的两处:正则按行切分时把 BiDi 控制字符算进长度、日志系统丢天城文变音符号,都会造成"数据看起来坏了"的假象——数据没坏,是管线对六语言文本的假设错了。
§7 生态与影响:Apollo 项目的评测件
§7.1 官方时间线:五则公告与一个双口径
GitHub README 的官方时间线(Update 区块逐条实录):
| 日期(README 口径) | 事件 |
|---|---|
| 2024.01.23 | Apollo repo 发布(代码先行) |
| 2024.02.12 | ApolloCorpus 和 XMedBench 发布(README 用词 “is published”) |
| 2024.03.07 | Paper 发布 |
| 2024.04.25 | MedJamba 发布(Mamba 架构的医疗变体) |
| 2024.10.15 | ApolloMoE 发布(专家混合架构,扩展至 50 语言) |
与机器元数据的交叉核对得出一个必须存照的双口径(FACTS 存照①):
- README 叙事口径:XMedBench 发布于 2024-02-12;
- HF API 元数据口径:数据集
createdAt = 2024-03-06T13:07:39Z——与论文 arXiv v1 提交日(2024-03-06)同日。
两个日期相差约三周,合理的解释是"公告先行、上架后置":项目组 2 月在 README 宣布发布,HF repo 的实际创建动作落在 3 月初、与论文同日。写作或引用时选一个口径并全文一致即可,本条目正文以 2024-03(元数据口径)为主线叙事、2024-02-12 作为官方公告口径并存标注。HF lastModified = 2025-02-15T18:06:24Z 说明发布后近一年仍有维护动作(最后一次),其后无更新记录。
时间线的另一半信息是后续演进:MedJamba(2024-04-25)把医疗 LLM 换到 Mamba 架构;ApolloMoE(2024-10-15)转向专家混合并扩展至 50 种语言——注意后者的评测不再限于 XMedBench 六语,XMedBench 是 Apollo 基线家族(0.5B/1.8B/2B/6B/7B)的专用考场,而非整个团队技术路线的唯一考场。
§7.2 多语言医疗评测景观中的位置
XMedBench 发布时点(2024 年初)的多语言医疗评测景观可以这样描画:每个语种都有自己的"单语言名册",但没有"跨语言统一的卷子"。
| 语言 | 本地已有评测资产(XMedBench 的上游或同源) | 统一化之前的痛点 |
|---|---|---|
| 英语 | MedQA-USMLE、MedMCQA、MMLU 医学子类、PubMedQA | 四者格式与判分口径不一 |
| 中文 | CMB、CMExam、CMMLU、MedQA-MCMLE | 同上,且与英语基准互不可比 |
| 西班牙语 | HEAD-QA | 单一题源,无对照 |
| 法语 | FrenchMedMCQA(321 题) | 体量极小,方差大 |
| 阿拉伯语 | (无本地医学考试基准) | 空白 |
| 印地语 | (无本地医学考试基准) | 空白 |
XMedBench 的生态位是"统一化"而非"新增":六个语种里只有阿/印地语是真正的新增评测资产(且是翻译件),其余四个语种都是对已有资产的汇编与格式统一。它的贡献在于把这张六语考卷放进同一个格式、同一个 prompt、同一个判分协议里,使"模型在中文强、在阿拉伯语弱"这类陈述第一次有了同卷可比的数字基础。
两个跟随关系值得点名(都出自论文与 README 的明确表述):
- 跟随 Med-PaLM2 的选择:MMLU 医学 6 子类清单与 MedQA 4-options 版本均跟随 Med-PaLM2(Singhal et al. 2023)的方法——这是英语医疗评测主流传统的延续。
- 跟随 Llama3 的多语评测方法:README 原话,阿/印地语切片 “compromised and followed Llama3’s multilingual evaluation method”,即用翻译版 MMLU 顶替本地基准——这与论文摘要的 “make a compromise” 相互印证。
还有一个反向插曲:PubMedQA 曾被试用后弃用。README 原话:“Because the results fluctuated too much, they were not used in the paper”——分数波动过大导致未进入论文实验。这是少见的"官方披露弃用原因"案例,对理解基准设计的取舍(弃开放问答、保单选 MCQA)是很好的注脚(§3.1)。
XMedBench 涉及的十一个上游题源资产的官方档案(供溯源时按图索骥):
| 题源 | 官方档案 | 与 XMedBench 的切片关系 |
|---|---|---|
| MedQA-USMLE | Zhang et al. 2018(题库论文);HF GBaker/MedQA-USMLE-4-options |
取 4-options 版本 1,273 题 |
| MedMCQA | Pal et al. 2022(题库论文);HF 原库 | 取 4,183 题(抽样规则未披露) |
| MMLU | Hendrycks et al. 2020(论文);原 GitHub | 医学 6 子类 1,871 题(跟随 Med-PaLM2 清单) |
| MedQA-MCMLE | MedQA 中文分支;HF bigbio/med_qa(med_qa_zh_4options 配置) |
3,426 题入中文切片 |
| CMMLU | Li et al. 2023a(论文);HF 原库 | 医学 7 子目录 1,333 题 |
| CMB | FreedomIntelligence 出品;HF FreedomIntelligence/CMB |
随机抽样 2,000 题单选(not used in paper) |
| CMExam | GitHub williamliujl/CMExam |
随机抽样 2,000 题(not used in paper;62 条多选的来源) |
| HEAD-QA | Vilares & Gómez-Rodríguez 2019(论文);原 GitHub/HF | 2,742 题(4 选项筛选版,存照⑥) |
| FrenchMedMCQA | Labrak et al. 2023a(论文);HF qanastek/frenchmedmcqa |
全量 321 题 |
| MMLU_Arabic | HF FreedomIntelligence/MMLU_Arabic(2023-08,MIT) |
医学部分翻译 → ar 1,088 题 |
| MMLU_Hindi | HF FreedomIntelligence/MMLU_Hindi(2023-08,MIT) |
医学部分翻译 → hi 1,089 题 |
这张表的用法:每个题源给出一篇论文/一个仓库的锚点,深挖任一上游时从锚点出发即可;注意"抽样规则未披露"出现在 MedQA/MedMCQA/MMLU/CMMLU 四个英语中文主力题源上——上游到切片的映射并非全量或随机抽样中的一种可声明情形,而是"论文未说明"状态,做子集级审计时要以 XMedBench 文件内实测为准,不能拿上游全量推断。
§7.3 影响面:论文渠道为主、数据计量为辅
XMedBench 的影响传播结构是典型的"论文附件型基准":它的被知悉渠道是 Apollo 论文(arXiv:2403.03640)与其后续工作(MedJamba、ApolloMoE 及第三方医疗 LLM 评测论文),而不是 HF 数据集页自身的检索流量——243 次下载(2026-09-30 实测)与论文渠道的曝光量完全不成比例。
这一结构的两个实际含义:
- 引用规范上,下游工作应同时引用论文与 HF 数据集(§6.5 BibTeX),只引论文不引数据集会使基准的可追溯性打折;只引数据集不引论文则丢失了构成表与实验协议的出处。
- 版本锚定上,论文有 v1(2024-03-06)至 v6(2024-10-12)多个版本,主结果表与叙事在版本间有演进;而 HF 数据本体 lastModified 停在 2025-02-15。引用"XMedBench 分数"时建议同时注明论文版本号(本条目主结果表出自 v6)——这是评测基准引用里最常被忽略的一格。
具体引用计量(Google Scholar / Semantic Scholar 读数)属实时变动数据,本条目不做快照存证;以抓取时点可核的事实为准——HF 计量 243/14 是本条目唯一实测的影响面数字。
§7.4 在千方病案医数集内的位置
在库内 AI-Ready Wikipedia 条目体系中,XMedBench 处于"医学问答与基准"大类下的多语言评测支线,与四条既有条目构成明确的互链网络:
| 库内条目 | rid | 关系 |
|---|---|---|
| ApolloCorpus | 718 | 姊妹对:训练语料(2.5B tokens)与评测基准同论文同日发布公告 |
| MedMCQA | 111 | 最大单一上游:英语切片 4,183 题(57.1%)来自它 |
| CMB-CMExam | 180 | 中文上游之二:CMB-single 与 CMExam 各抽样 2,000 题入库 |
| HeadQA | 120 | 西语上游:es 切片 2,742 题为其(筛选/转换后的)版本 |
逐对关系的详析在 §9;此处给出全景定位——XMedBench 是库内第一条以"多语言统一评测面"为核心身份的 MCQA 基准条目,与单语言上游条目(MedMCQA、HeadQA、CMB-CMExam)构成"源-汇"关系,与 ApolloCorpus 构成"训-测"关系。检索路径上,从任何一条上游条目出发都应能一跳到达 XMedBench,反之亦然(§9.5 给出互链落点清单)。
§8 方法学启示:六条可迁移的经验
XMedBench 本身只是一份 33 MB 的 JSON 汇编,但它的设计过程把"多语言评测基准怎么做"这个方法论问题演示了一遍。以下六条经验对所有要造基准、用基准、评基准的团队都可迁移。
§8.1 同构优先于同源:"最大公约数"设计
XMedBench 最核心的设计决策不是"收录了哪些题",而是"把所有题都削成了什么形状":四选项单选 MCQA、四字段 JSON、单一 prompt 模板。六个语种的上游题源五花八门(MedQA 是长题干临床案例、MedMCQA 是短题干记忆题、MMLU 是跨学科通识、HEAD-QA 原版是五选项),全部被削到同一个公约数上。
这一决策的回报是跨语言可比性:同一模型在六语言上的分数差可以归因于语言与题源,而不用先排除"任务格式不同"的干扰。代价是信息损失:HEAD-QA 被从五选项削成四选项(FACTS 存照⑥,论文未披露筛选规则)、中文混入了多选题(存照⑦,未披露)、开放问答能力完全不可测。造基准者的第一课:统一格式买到的是可比性,付出去的是保真度——取舍要明说。
§8.2 妥协要写进论文:"make a compromise"的示范
论文对阿/印地语切片的处理值得所有基准作者抄作业:它没有把翻译件包装成"多语言原生覆盖",而是原话承认 “we make a compromise by applying translated versions of MMLU”,README 进一步披露 “compromised and followed Llama3’s multilingual evaluation method”。
同样诚实的还有 PubMedQA 的弃用披露:“Because the results fluctuated too much, they were not used in the paper”——一个试过、发现分数不稳、然后放弃并说明原因的完整决策链。对比业界常见的做法(悄悄换题源、只在 changelog 里留一行),这两处披露是基准文档的加分项:妥协不可怕,不披露的妥协才可怕。使用者据此可以正确解读阿/印地语分数(混合了医学知识与翻译理解两种误差源,§3.5),而不是把它当成"模型印地语医学能力"的纯度量。
§8.3 文档与数据的口径一致:"not used"之谜的教训
反面教材也来自同一份文档。README 写 CMB-single 与 CMExam “(not used, randomly sample 2000)”,两个词组并排造成的默认读法是"这两个题源没进基准"——但数据实测 4,000 题全部在场(§3.3)。“not used” 的本意是"未用于论文主表实验",缺失了"但仍包含在发布数据中"这半句。
这个案例的可迁移教训是:评测数据集的 README 是最容易被断章取义的文档。写作者应当对每个否定性陈述做"两分法"自查——“未用于 X"不等于"未包含于 Y”;使用者应当在任何一次复现前做数据实测(Counter([r["source"] for r in records]) 一行代码的事),把文档口径与数据口径对表。本条目的全部 source 分布表就是这么来的,也正是这个动作把"not used 之谜"变成了可存照的硬事实(坑 5、存照⑧)。
§8.4 小切片的方差要管理,至少要标注
法语 321 题占全基准 1.5%。在这个切片上,95% 置信区间半宽约 ±5 个百分点(§2.1)——意味着两个模型在法语上 3 分以内的差异没有任何统计意义,但排行榜读者不会自发知道这一点。XMedBench 没有在任何文档里给出方差提示,这是它欠使用者的一笔账。
可迁移的做法:基准文档应随附每语言切片的置信区间参考表,或至少在 README 给出一行警示。使用者的对冲做法:跨语言排名时把小于 ±1.96·sqrt(p(1-p)/n) 的差距视为并列;对 321 题级的切片,任何"单点结论"都应改用"区间结论"表述。九列分数中方差最大的法语列(1-3 分的模型间差异无统计意义,§4.5)应作为默认心理校准。
§8.5 训-测姊妹对:一体发布的好处与审计债
ApolloCorpora(训练)与 XMedBench(评测)同论文、同日公告、同组织发布,构成"训-测姊妹对"。好处:数据隔离的动机与责任落在同一家,训练语料的构成(Table 2 十类,含 Exams 类 78.0M tokens)全部公开可审计;坏处:同源也意味着污染风险的内生性——训练用的考试题与评测题都来自医学考试生态,而逐题级的隔离清单论文并未给出(坑 8)。
姊妹对模式的正确打开方式是把审计义务一并发布:训练题集与测试题集的 n-gram 重叠率、题干去重报告、逐题来源清单。XMedBench 发布时点(2024 年初)业界尚无此惯例,情有可原;但 2026 年的今天,任何新基准若再以"姊妹对"模式发布而缺失隔离审计,都应被视为文档债。使用者侧的对冲:复现 Apollo 系列分数时接受"同门可能自污染"的先验,把 Apollo 与第三方模型(Qwen、Llama、Gemma)的对照列作为更干净的参照系。
§8.6 低资源语言:有总比无好,但要知道"有"的是什么
阿/印地语切片是全基准最弱的两个语言(翻译件、无本地题源),但也是其宣称覆盖 6.1B 人口叙事所必需的两块拼图。这里有一个值得记住的不对称:低资源语言的评测资产从零到一的价值,远大于其从一到精的价值——1,088/1,089 题的翻译件虽然粗糙,却让"阿拉伯语医疗能力"第一次进入主流评测视野;而它的粗糙之处(翻译腔、文化错位、美国医疗体系背景)也确实限制了分数的可解释性。
对造基准者:低资源语言起步时用翻译件是合理的,但应像 XMedBench 一样披露妥协性质,并明确"这是下限校准器、不是能力天花板"。对使用者:低资源分数用于模型间相对比较(同卷可比)尚可,用于绝对能力断言(“X 模型掌握了印地语医学”)不可。
§9 与库内条目的关系
§9.1 家族图谱
库内与本条目直接相关的五个节点(含本条目):
┌──────────────────────────────┐
│ Apollo 论文 (arXiv:2403.03640) │
│ 训练 + 评测 三件套 │
└──────┬───────────────┬───────┘
│ │
┌────────────▼───┐ ┌───────▼────────────┐
│ ApolloCorpus │ │ XMedBench(本条目) │
│ (rid 718) │ │ 21,326 题·六语言 │
│ 2.5B tokens │ └───┬────┬────┬────┬──┘
│ 训练语料 │ │ │ │ │
└────────────────┘ 英 │ 中 │ 西 │ 法 │ 阿/印地
▲ │ │ │ │
│ ┌─────▼─┐ ┌▼──────┐ ┌▼────────┐ ┌──────────┐ ┌────────────┐
训练用 Exams│ │MedMCQA│ │CMB- │ │HeadQA │ │FrenchMed │ │MMLU_Arabic │
同源生态───┘ │(111) │ │CMExam │ │(120) │ │MCQA(库内 │ │/MMLU_Hindi │
│4,183题│ │(180) │ │2,742题 │ │暂无独立条目)│ │(翻译件,库内暂无)│
└───────┘ └───────┘ └─────────┘ └──────────┘ └────────────┘
§9.2 ApolloCorpus(rid 718):训-测姊妹对
两者出自同一篇论文、同一次发布公告(2024-02-12 口径)。ApolloCorpus 是 2.5B tokens 的训练语料(十类构成,Web 886.7M 为最大类),XMedBench 是评测件。十类训练语料与六语评测面的重叠关系:
| ApolloCorpora 类别 | 阶段 | tokens | 与 XMedBench 的关系 |
|---|---|---|---|
| Web | 继续预训练 | 886.7M | 无直接关系(背景知识) |
| General IT | 指令微调 | 364.9M | 提供多语指令跟随能力(间接影响全列分数) |
| Books | 继续预训练 | 413.8M | 无直接关系 |
| Papers | 继续预训练 | 349.0M | 无直接关系 |
| Encyclopedias | 继续预训练 | 226.2M | 无直接关系 |
| Dialogues | 继续预训练 | 149.1M | 无直接关系 |
| Exams | 指令微调 | 78.0M | 与评测题同源生态(考试题),隔离审计开放(坑 8) |
| Guidelines | 继续预训练 | 29.6M | 无直接关系 |
| Math IT | 指令微调 | 22.6M | 无直接关系 |
| Code IT | 指令微调 | 16.4M | 无直接关系 |
相互印证的检索点:ApolloCorpus 条目描述训练侧的 Exams 类(78.0M tokens),与本条目的评测题同属医学考试生态但功能不同(喂模型 vs 考模型);两者合并阅读才能还原 Apollo 项目的完整方法学(§5.1 三件套分工表)。引用惯例:训练相关论述引 ApolloCorpus 条目与论文 Table 2,评测相关论述引本条目与论文 Table 3。
§9.3 MedMCQA(rid 111):英语切片的最大上游
XMedBench 英语 7,327 题中 4,183 题(57.1%)来自 MedMCQA——库内 MedMCQA 条目记录的印度 AIIMS/NEET-PG 考试题库。两个条目之间的数据流是"抽样上游":XMedBench 取了 MedMCQA 的一个子集(而非全部),子集抽样规则论文未披露。反向检索时注意:在 MedMCQA 条目里看到的规模数字(训练 182,822 / 验证 4,183 / 测试 6,150 的原版划分)与 XMedBench 内的 4,183 题是"上游验证集恰好同量级"的巧合还是有意选取,论文未言明(这与本条目 §2.4 的实测 source 计数并存,两种口径勿混)。难度解读的差异(MedMCQA 记忆型题源的偏科问题)见坑 7。
§9.4 CMB-CMExam(rid 180):中文上游的双抽样源
库内该条目覆盖 CMB(Chinese Medical Benchmark)与 CMExam 两个中文题库;XMedBench 从两者各随机抽样 2,000 题纳入中文切片,且 README 明言这 4,000 题"not used in the paper"(未入论文实验但入了发布基准,§3.3)。三个互链检索点:其一,62 条多选题全部来自 cmexam(存照⑦)——在 CMB-CMExam 条目语境里 CMExam 原生含多选题,进入 XMedBench 后未被过滤,这是"源-汇"格式差异的活案例;其二,cmb-single 全部 2,000 条为五选项题——与 XMedBench"四选项统一"的宣称形成中文切片内部的例外(§2.2 实测);其三,"not used"之谜(坑 5)的源头文档在 Apollo GitHub README,数据实证在库内两条目可交叉完成。
§9.5 HeadQA(rid 120):西语全量上游与一个筛选存照
XMedBench 西语 2,742 题全部标记 source=headqa。库内 HeadQA 条目记录的原版 HEAD-QA 是五选项(A-E)设计;XMedBench 版实测全四选项——即经过筛选或转换(FACTS 存照⑥),论文未披露规则。这是库内两条目间最重要的口径差异:从 HeadQA 条目跳到本条目的读者,应把"2,742 题同数、选项数不同"作为第一注意点。原版 HEAD-QA 的专业方向构成(药学/心理学/护理/医学等 PIR/IRN 考试)与许可(CC BY 4.0,§6.4)在 HeadQA 条目有完整档案,本条目不重复展开。
§9.6 互链落点与检索路径
建议的双向互链锚点(供发布系统挂链):
| 本条目出链 → | 库内条目 → 本条目入链建议 |
|---|---|
| §5(姊妹关系)→ ApolloCorpus | ApolloCorpus §评测件 → 本条目 |
| §2.4/§3.2(上游点名)→ MedMCQA | MedMCQA §下游使用 → 本条目(英语 57.1% 上游) |
| §2.4/§3.3(not used)→ CMB-CMExam | CMB-CMExam §下游抽样 → 本条目(各 2,000 题) |
| §2.5/§9.5(西语切片)→ HeadQA | HeadQA §下游改编 → 本条目(4 选项筛选版) |
检索路径示范:从"多语言医疗评测"语义出发命中本条目;从"印度医学考试题"出发命中 MedMCQA 再一跳到本条目;从"Apollo 模型训练数据"出发命中 ApolloCorpus 再一跳到本条目。四条路径覆盖了"训-测""源-汇"两个维度,互链网络无孤岛。
§10 避坑清单、DAIMS 与存照
§10.1 八个已踩过或必然踩的坑
坑 1:大小写三态,检索与代码双杀。官方 HF repo id 是 FreedomIntelligence/XMedbench(b 小写,API 302 证实);论文与社区通篇写作 XMedBench(b 大写);repo 内整包文件名却是 XMedBench.zip(大写 B);README 内链又写 XMedbench.zip(小写 b)。加上 HF config 的 split 名 english/chinese/french/spanish/arabic/Hindi 中 Hindi 独大写(其余全小写),一共五处大小写不一致。代码侧 load_dataset(...) 的 split 参数大小写敏感;检索侧大小写敏感的索引器会漏检。README 标语 “Covering English, Chinese, French, Hindi, Spanish, Hindi, Arabic So far” 里 Hindi 重复出现两次——又一处官方笔误(FACTS 存照⑤)。
坑 2:options 是字符串不是数组,answer 带括号,题型还混合。options 字段是 (A) xx\n(B) yy\n(C) zz\n(D) ww 的换行分隔纯文本;answer 是 "(A)" 式带括号字母。更隐蔽的是中文切片的混合题型:4 选项 4,832 条 + 5 选项 3,927 条,另有 62 条多字母组合答案((AB)/(ABC) 式,全部来自 cmexam)。按"固定四选项"写的解析器会在中文切片上静默出错(§6.2 给出了兼容骨架)。
坑 3:README 的 HI/AR 上游链接互换。HF/GitHub README 的 Data 区块里,Hindi 条目链接指向 FreedomIntelligence/MMLU_Arabic、Arabic 条目链接指向 FreedomIntelligence/MMLU_Hindi——两行互换了。正确映射以论文脚注为准:Hindi→MMLU_Hindi、Arabic→MMLU_Arabic(FACTS 存照②)。溯源翻译件时别照抄 README 链接。
坑 4:resolve 端点必须 -L 跟随重定向。HF 与 hf-mirror 的 /resolve/main/<path> 都先返回 302 到 CDN;curl 不带 -L 会把 78 字节的 “Temporary Redirect” 文本存成 .json,随后 JSON 解析报错,极易误判为"数据文件损坏"。curl -L 或 wget(默认跟随)或 huggingface-cli download 规避。
坑 5:“not used"不等于"不在场”。README 写 CMB-single 与 CMExam “(not used, randomly sample 2000)”,实测 4,000 题全部包含在 test/zh.json 中(§3.3)。“not used” 仅指未用于论文主表实验。复现论文数字必须按 source 过滤(中文只取 medqa-mcmle + cmmlu-medical 共 4,759 题,全库论文口径共 17,326 题);做全基准评测则用 21,326 题——两种口径的分数不可混排(FACTS 存照⑧)。
坑 6:FrenchMedMCQA 的名称三处不一。论文正文拼写为 FrenMedMCQA(少一个 c,Labrak et al. 2023a 口径);标准名为 FrenchMedMCQA;实际 HF repo 归属 qanastek/frenchmedmcqa(qanastek 即一作 Yanis Labrak),不在 FreedomIntelligence 名下;XMedBench 数据内 source 标签为全小写 frenchmedmcqa。检索该上游时四个写法都要试(FACTS 存照④)。
坑 7:英语近六成来自记忆型题源,别把 MedMCQA 分数当临床能力。英语切片 57.1% 来自 MedMCQA(印度医学入学考试,题干短、记忆型比重大,§2.4)。模型在英语列的高分(如 GPT-4 MedMCQA 70.40)混合了知识回忆与应试模式匹配,与 MedQA-USMLE 列(临床案例长题干,GPT-4 79.10)考察的能力结构不同。跨列比较或"英语医疗能力"的笼统断言都要先想清楚题型构成。
坑 8:训-测隔离审计是开放的。ApolloCorpora 的 Exams 类(78.0M tokens)与 XMedBench 的评测题同属医学考试生态;训练题与测试题的逐题隔离清单论文未发布,n-gram 重叠率未见官方报告。复现 Apollo 系列在 XMedBench 上的分数时,应保留"同门基准、同门语料"的先验折扣,以第三方模型对照列为更干净的参照(§5.2、§8.5)。
§10.2 DAIMS 评估
| 维度 | 评分(1-10) | 逐项拆解 |
|---|---|---|
| D 可发现性 | 7 | +:HF 页可索引、arXiv tag 关联、README 构成表完整;−:大小写三态使首轮检索易漏(坑 1)、HF 计量低(243 下载)削弱页权重、无独立官网页(挂在 apollo.llmzoo.com 子页) |
| A 可获取性 | 9 | +:公开直链、gated=false、33.4 MB 一次下载、hf-mirror 可达、Apache-2.0 允许再分发;−:无 DOI/Zenodo 归档,持久性完全绑定 HF 平台与 GitHub org |
| I 可互操作 | 7 | +:JSON 标准格式、datasets/pandas/polars/mlcroissant 四库支持、字段极简;−:options 非结构化需自行解析(坑 2)、answer 带括号需归一化、无官方字段 schema 文档、zh 题型混合破坏"四选项同构"假设 |
| M 元数据质量 | 7 | +:README 构成表与论文 Appendix B.1 双证、上游许可逐层可查(§6.4)、时间线公开;−:三处文档债——"not used"措辞误导(坑 5)、HI/AR 链接互换(坑 3)、多选题未披露(存照⑦) |
| S 可持续性 | 6 | +:Apache-2.0 宽许利于社区续存、体积小易镜像;−:lastModified 2025-02-15 后无维护、无版本化发布(无 DOI/无 tag)、上游翻译件(MMLU_Arabic/Hindi)同样停更、组织维护强度未知 |
| 综合评级 | 7.2/10(中上) | 获取与格式长板突出、文档与续存有明确短板;短板均有具体修复路径(补 DOI、发 schema、修 README 三处)——属于"债已列明"的 AI-Ready 正面样本 |
§10.3 存照清单:八个双口径与四个待核项
成稿引用全部硬数字时的口径存照(与 FACTS.md §9 一一对应):
| 存照 | 事项 | 口径 A | 口径 B | 成稿采用 |
|---|---|---|---|---|
| ① | 发布日期 | HF README 公告 2024-02-12 | HF API createdAt 2024-03-06T13:07:39Z | 正文以 2024-03 元数据口径为主线,公告口径并存标注(§7.1) |
| ② | HI/AR 上游链接 | README:两行互换 | 论文脚注:Hindi→MMLU_Hindi、Arabic→MMLU_Arabic | 按论文口径,标注 README 错误(坑 3) |
| ③ | 作者人数 | BibTeX/HF/GitHub 引用块 10 人 | arXiv 页 12 人(多 Guorui Zhen、Chunxian Zhang) | 引用按 BibTeX,人物叙述按 arXiv 并注差异(§6.5) |
| ④ | 法语题源名称 | 论文正文 FrenMedMCQA | 标准名 FrenchMedMCQA;repo qanastek/frenchmedmcqa |
正文用标准名,论文拼写存照(坑 6) |
| ⑤ | 大小写 | repo id XMedbench/文件 XMedBench.zip |
显示名 XMedBench;split Hindi 独大写;README 标语 Hindi 重复 |
显示名统一 XMedBench,机器 id 存照(坑 1) |
| ⑥ | 西语选项数 | XMedBench es 切片全 4 选项(实测) | 原版 HEAD-QA 为 5 选项(A-E) | 如实写"筛选/转换版",规则未披露(§9.5) |
| ⑦ | 中文多选题 | 实测 62 条多字母答案(全 cmexam)+ 3,927 条五选项 | README 仅言 “randomly sample 2000 multiple-choice questions” 未提多选/五选项 | 如实写混合题型(坑 2) |
| ⑧ | 总规模口径 | repo 口径 21,326 题 | 论文实验口径 17,326 题(21,326−4,000 条 not used) | 以 repo 口径 21,326 为准,论文口径并注(坑 5) |
四个待核项(FACTS 待核 1-4,诚实清单):
- Apollo-2B 的分数行:论文宣称发布五档尺寸(0.5B/1.8B/2B/6B/7B),本条目实抓的 v6 Table 3 提取到 Apollo-2B 平均 39.94(已列入 §4.2),但该行与 README 材料的交叉核对未完成第二来源确认——引用 Apollo-2B 分数时建议再对论文原件一次。
- 论文 v1→v6 的版本间差异:本条目主表与引文均出自 v6(ar5iv 实抓);早期版本的表格数字是否一致未逐版核对。
- Medbase 的关系:repo
assets/Medbase.png的存在暗示另一产品线(Medbase),与 XMedBench 的确切关系未深究。 - README_zh.md 中文版:repo 内存在中文 README,本条目未单独抓取核对——若其中文表述与英文版有出入,以英文版为准(成稿口径)。
§11 总结
11.1 三句话总结
- XMedBench 把英中法西阿印地六种语言的 21,326 道医学考题削成同一个四选项 MCQA 格式,是 2024 年时点唯一覆盖阿/印地语的医疗评测基准——尽管后两者是 MMLU 翻译件(论文自认妥协)。
- 它是 Apollo 论文(arXiv:2403.03640)的评测件:GPT-4 平均 73.37%,Apollo-7B 以 58.78% 拿下 ≤70B 开源 SOTA,多语联合训练比最佳单语模型高 5.4 分——"低资源语言不该单独训模型"在此有了医疗领域的定量证据。
- Apache-2.0、33.4 MB、直链无门槛使它成为 AI-Ready 的正面样本;但 options 非结构化、"not used"措辞误导、README 链接互换、大小写五处不一致,构成使用前必读的八坑清单(§10.1)。
11.2 适合谁
- 医疗 LLM 评测团队:要一张六语言同构、判分零歧义的知识考卷。
- 多语言 NLP 研究者:研究低资源语言(阿/印地语)的医学能力迁移与指令跟随崩塌(Llama-2-70B 阿语 1.65% 是现成的崩塌样本)。
- 基准工程学习者:训-测姊妹对、"最大公约数"设计、妥协披露——三个活的方法学案例(§8)。
- 数据集审计者:上游许可分层、双口径存照、坑点文档化都是可复用的审计模板。
11.3 不适合谁
- 需要"会看病"证据的团队:它是知识考试,不是临床推理、医患对话或多轮决策的度量(§3.1 定位边界)。
- 需要母语出题质量的阿/印地语研究:翻译件的三重误差(术语、文化、流畅度)使绝对分数解释受限(§3.5)。
- 需要大切片统计功效的语言学实验:法语 321 题、阿/印地语各约 1,088 题,±5pp 级的置信区间会吞掉大部分效应量(§8.4)。
- 需要持续维护与官方答疑的项目:lastModified 2025-02-15 后无更新记录,按"静态快照"预期管理。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 立刻想跑个评测 | huggingface-cli download FreedomIntelligence/XMedbench(33.4 MB)→ §6.2 四种加载姿势任选 |
| 复现论文 Table 3 | 按 §10.1 坑 5 过滤:中文只取 medqa-mcmle+cmmlu-medical,全库论文口径 17,326 题;prompt 模板抄 §3.4 |
| 评估自家模型的多语言医疗能力 | 全 21,326 题 + 按 §10.1 坑 2 解析 options + 报告分区置信区间(§8.4) |
| 引用 | §6.5 BibTeX(10 作者口径)+ 注明论文版本(本条目主表出自 v6) |
| 审计许可 | §6.4 分层表:主体 Apache-2.0,HEAD-QA 层 CC BY 4.0 署名穿透,CMMLU 单独协议逐核 |
| 找训练数据 | 不是这里——去库内 ApolloCorpus(rid 718);本条目是考场不是粮仓 |
| 想造自己的多语言基准 | 先读 §8 六条经验,尤其 §8.3(文档-数据口径一致)与 §8.4(小切片方差) |
FAQ(高频问答 30 问)
A. 基础认知
Q1:XMedBench 是数据集还是榜单?
两者都是但以数据集为本体:21,326 道题的静态 JSON 汇编(数据集),论文 Table 3 提供了首批官方分数(榜单性质的参照系)。它没有在线 leaderboard,提交分数靠论文自报。
Q2:XMedBench 和 MMLU 是什么关系?
部分子集关系加翻译关系:英语与阿/印地语切片直接取自 MMLU 医学 6 子类(阿/印地语为翻译版);中文的 CMMLU 是 MMLU 的中文对应物但原生出题;西语 HEAD-QA、法语 FrenchMedMCQA 与 MMLU 无关。
Q3:为什么是这六种语言?
论文口径:英中法西阿印地是使用人口最多的语言之一,合计覆盖约 6.1 十亿人(摘要原话 “encompassing a global population of 6.1 billion”)——这是人口逻辑,不是医疗资源逻辑。注意 6.1B 是人口数,与训练语料 ApolloCorpora 的 2.5B tokens 无关(§5.2)。
Q4:它是免费的吗?商用呢?
免费且 Apache-2.0——使用、修改、商用、再分发均获授权(汇编层)。注意上游 CC BY 4.0(HEAD-QA 层)的署名穿透与 CMMLU 单独协议(§6.4)。
Q5:XMedBench 会更新吗?
发布后最后一次修改是 2025-02-15(HF API lastModified),其后无更新记录。按静态快照使用;ApolloMoE(2024-10-15)之后的团队工作转向 50 语言评测,不再以此六语集为唯一考场(§7.1)。
B. 数据与获取
Q6:怎么最快拿到数据?
huggingface-cli download FreedomIntelligence/XMedbench --repo-type dataset --local-dir xmedbench——33.4 MB 一次到位。大陆网络走 hf-mirror 同路径,直链记得 -L(坑 4)。
Q7:test/ 和 questions/ 两套文件用哪套?
评测用 test/(四字段带答案);questions/ 只有题干字符串列表,无选项无答案,用于自建选项或开放式评测,用前需自备答案键(§2.3)。
Q8:options 字段为什么解析报错?
它是 (A) xx\n(B) yy... 的字符串不是数组;且中文切片有 5 选项题(3,927 条)与 62 条多字母答案——按"固定四选项+单字母答案"写的解析器必炸(坑 2,兼容骨架见 §6.2)。
Q9:法语为什么只有 321 题?
法语本地医学 MCQA 资产稀缺,XMedBench 收录的 FrenchMedMCQA 本身就是一份 321 题的翻译项目(Labrak et al. 2023a)。小切片意味着 ±5pp 级的置信区间,跨语言排名时注意(§8.4)。
Q10:阿/印地语切片能当母语质量用吗?
不能。它们是 MMLU 医学部分的翻译版(论文自认 “make a compromise”),存在术语译名不统一、文化背景错位、翻译腔三重误差——用作相对比较尚可,用作绝对能力断言不可(§3.5)。
C. 评测与解读
Q11:GPT-4 在 XMedBench 上多少分?说明什么?
平均 73.37%(v6 Table 3):九列中最高是 MMLU 医学◇ 86.00 与法语 89.72,最低是阿语 56.43。说明顶级模型在医疗知识考试上远未饱和,且语言落差真实存在(§4.2)。
Q12:Apollo-7B 的 58.78% 是什么水平?
发布时点 ≤70B 开源医疗模型的最高平均分(论文宣称)。对照:Gemma-7B 52.44、MMedLM2-7B 51.45、Qwen-14B 52.67、Yi-34B 47.00——同级与更大尺寸的通用模型均被超过(§4.2)。
Q13:为什么 Llama-2-70B 的阿语只有 1.65%?
低于 25% 的随机基线,说明不是"知识不足"而是阿拉伯语上的指令跟随/格式输出崩溃——模型没能稳定输出可解析的选项字母。这是低资源语言评测的经典现象,分数低不一定是医学能力低(§4.2)。
Q14:六语言平均分可以直接排名吗?
谨慎。中文切片 8,759 题(41.1%)主导平均分权重;若把"not used"的 4,000 题也算进去,与论文口径又不可比。建议分区报告 + 置信区间,平均分仅作参考(坑 5、§8.4)。
D. 复现与库内
Q15:怎么复现论文的中文分数?
只评 test/zh.json 中 source 为 medqa-mcmle(3,426)与 cmmlu-medical(1,333)的题,共 4,759 题;prompt 用 §3.4 模板。全量 8,759 题会混入论文未实验的 4,000 题,数字对不上表(坑 5)。
Q16:训练数据在哪?
不在本仓库。训练语料是姊妹数据集 ApolloCorpora(2.5B tokens,HF FreedomIntelligence/ApolloCorpus),与 XMedBench 同论文发布——库内 ApolloCorpus(rid 718)条目有完整档案(§5、§9.2)。
Q17:库内哪些条目和它互链?
ApolloCorpus(718,姊妹对)、MedMCQA(111,英语 57.1% 上游)、CMB-CMExam(180,中文各 2,000 抽样上游)、HeadQA(120,西语 4 选项筛选版上游)——四条一跳路径全覆盖(§9.6)。
Q18:引用时最容易被挑错的是什么?
三件事:论文标题写错(正确为 “Apollo: Lightweight Multilingual Medical LLMs towards Democratizing Medical AI to 6B People”,LLMs 复数);作者数口径(BibTeX 10 vs arXiv 12);发布日期口径(2024-02-12 公告 vs 2024-03-06 上架)——本条目 §6.5 与 §10.3 存照①③已给出现成答案。
E. 数据工程细节(进阶)
Q19:每道题平均多长?评测时的 token 预算怎么估?
题干字符长度实测(§2.6):en 均值 230/中位 85/最长 4,671;zh 均值 34/中位 18。最长英文题约 1,100+ token,加上选项与 prompt 模板,单题 2,048 token 上下文即可全覆盖;批处理按语言分别设桶可省一半算力。
Q20:英语题干为什么是双峰分布?
短峰是 MedMCQA(记忆型短题干,4,183 题),长尾是 MedQA-USMLE(临床案例长题干,1,273 题)——source 构成直接决定长度形态(§3.6)。做长度分层评测时这个双峰是天然的分层依据。
Q21:同一道题会出现在多个语言里吗?
会跨语言"双生"。阿/印地语切片是同一批 MMLU 医学题的两种翻译——实测中同一道题(如面神经受压题)在 ar 与 hi 各有一份译文,且与英语原题同源(附录 G 实录)。这不是库内重复,但跨语言聚合分析时要知道三份是同一知识点。
Q22:怎么验证我拿到的数据是完整且正确的?
跑 §6.7 的八项自检清单:行数合计 21,326、四字段齐全、source 取值集合、选项数分布、answer 格式、zh 交叉表、questions 形态一致性、编码检查。任一项不匹配即版本或下载有问题。
Q23:62 条多选题怎么判分?
答案为 (AB)/(ACE) 式多字母组合,全部在 cmexam。常规做法:全对得 1 分、部分得 0 分(严格判分),并在报告里单独列出这 62 条的成绩——混入单选平均分会引入题型混杂误差(附录 D 交叉表)。
Q24:5 选项题(fr 全部 + zh 3,927 条)在评测协议里怎么处理?
prompt 模板是 “A to D”(§3.4)——严格按模板时五选项题需要扩展选项行(“A to E”)或过滤。复现论文中文分数(只取 medqa-mcmle+cmmlu-medical,全 4 选项)则天然避开此问题;全基准评测时必须在协议里声明处理方式。
Q25:options 解析的正则怎么写才健壮?
按 \n 切分后逐行匹配 ^\(([A-E]{1,5})\)\s*——{1,5} 兼容多字母、行首锚定防题干换行误切、剥离前缀后保留原文(§6.2 骨架)。避免用 split('(A)') 这类字符串切割——题干正文里可能出现括号字母序列。
Q26:有官方去重报告吗?
没有。库内精确重复与跨语言双生(Q21)都无官方披露,自建评测前建议做语言内题干精确去重与跨语言规范化对齐(小写化+去空白后的哈希对比),结果随报告发布——这正好补上基准欠的一笔元数据债(§10.2 维度 M)。
Q27:source 字段能当分层抽样依据吗?
能且应该。source 是全库唯一可靠的分层键(八个取值、每层规模见 §2.4/§2.5)。做子集评测(如"只测临床推理型")或构建平衡评测子集时按 source 分层,比随机抽样更能控制题源偏差(§3.6 难度构成学)。
Q28:论文里引用具体题目有什么规范?
引用 question 原文时标注:语言文件 + source 标签 + 序号(如 “test/zh.json 中 cmexam 第 N 条”),并注明基准版本(HF lastModified 2025-02-15 前的数据)与论文版本(v6)——四元组齐备才能被别人复现到同一道题。
Q29:多语言平均分怎么报告才严谨?
三层结构:语言分区分数(六列各自报)→ 分区置信区间(法语等小切片必报,§8.4)→ 总平均(声明权重口径:按题数加权则中文占 41.1%,按语言平均则法语与英语同权——两种口径可差 10 个百分点以上,必须声明用的是哪种)。
Q30:用 XMedBench 训练自己的模型会不会污染?
评测题本身不能进任何训练集(这是基准使用的基本伦理);更隐蔽的是近邻污染——用 MedMCQA/CMB/CMExam 等同源题库训练后直接在 XMedBench 上评测,会经由上游重叠抬分。官方未提供隔离清单,自建训练集时应做与 XMedBench 六文件的题干 n-gram 重叠筛查并报告(坑 8 的使用者侧实践)。
Q31:数据里有格式伪影吗?怎么处理?
有,且都有实物样例(附录 G):西语选项尾部双句点(“Colágeno…”,HEAD-QA 源级伪影)、英语长题干内含换行(最长 4,671 字符)、阿/印地语的 RTL 与天城文字符。处理原则:清洗逻辑容忍伪影而非报错;判分归一化只动 answer 字段(括号剥离),不动题面原文。
Q32:它和库内其他"医学问答与基准"条目是什么分工?
库内评测类条目各占一个任务面:XMedBench 占"多语言知识考试 MCQA";MedMCQA/CMB-CMExam/HeadQA 是它的单语言上游;MedCalc-Bench 占医学计算,ReX 系占报告生成与 VQA——任务类型不同,互为互补而非竞争。检索"多语言医疗评测"语义时以本条目为入口。
事实清单(硬事实 36 条)
- 总量 21,326 题:HF 页面索引、六语言文件逐一计数求和、size_categories 10K<n<100K 三重印证
- 六语言分布:en 7,327 / zh 8,759 / fr 321 / es 2,742 / ar 1,088 / hi 1,089(全部为 2026-09-30 本地实测)
- 英语 source 分布:medmcqa 4,183(57.1%)/ mmlu-medical 1,871(25.5%)/ medqa-usmle 1,273(17.4%)
- 中文 source 分布:medqa-mcmle 3,426 / cmb-single 2,000 / cmexam 2,000 / cmmlu-medical 1,333
- fr 全部 source=
frenchmedmcqa;es 全部headqa;ar 全部mmlu-medical-ar;hi 全部mmlu-medical-hi(四语全量实测) - 选项数实测:en 全 4;zh 混合(4 选项 4,832 + 5 选项 3,927);fr 全 5;es 全 4(原版 HEAD-QA 为 5);ar/hi 全 4
- zh 多选题 62 条(多字母组合答案),全部来自 cmexam(存照⑦)
- en answer 分布:(A) 2,107 / (B) 1,850 / © 1,708 / (D) 1,662——无显著偏斜
- 字段四件套:question / options / answer / source;options 为换行分隔字符串(非数组);answer 为
(A)式 - repo 双形态:
test/{lang}.json六个(带答案)+questions/{lang}_question.json六个(纯题干列表)+XMedBench.zip - 体量:usedStorage 33,383,744 字节 ≈ 33.4 MB;19 个文件(API siblings 实录)
- 许可:Apache-2.0(cardData.license + tags 双证);gated=false;上游 MMLU_Arabic/Hindi 为 MIT(2023-08-06)
- HF 计量(2026-09-30):downloads 243、likes 14
- HF API 时间戳:createdAt 2024-03-06T13:07:39Z、lastModified 2025-02-15T18:06:24Z
- GitHub README 时间线:repo 2024-01-23 / corpus+bench 2024-02-12 / paper 2024-03-07 / MedJamba 2024-04-25 / ApolloMoE 2024-10-15
- 论文:arXiv:2403.03640,v1 2024-03-06 提交,实抓 v6(2024-10-12)
- 标题精确口径:Apollo: Lightweight Multilingual Medical LLMs towards Democratizing Medical AI to 6B People(LLMs 复数)
- 团队:FreedomIntelligence(香港中文大学(深圳)+ 深圳大数据研究院);通讯作者 Benyou Wang(王本友)
- 作者数:BibTeX 10 人 vs arXiv 页 12 人(存照③);前三作者同等贡献
- MMLU 医学 6 子类(跟随 Med-PaLM2):Clinical knowledge / Medical genetics / Anatomy / Professional medicine / College biology / College medicine
- CMMLU 医学 7 子目录:Anatomy / Clinical knowledge / College medicine / Genetics / Nutrition / Traditional Chinese Medicine / Virology
- PubMedQA:试用后弃用,README 原话 “Because the results fluctuated too much, they were not used in the paper”
- 阿/印地语:论文原话 “make a compromise by applying translated versions of MMLU”;README 口径 “followed Llama3’s multilingual evaluation method”
- 主结果(v6 Table 3 平均分):GPT-4 73.37 / Qwen-72B 68.74 / Apollo-7B 58.78(≤70B 开源 SOTA)/ GPT-3.5 57.80 / Gemma-7B 52.44 / MMedLM2-7B 51.45 / Llama-2-70B 36.63
- Apollo 家族平均:7B 58.78 / 6B 57.54 / 1.8B 44.74 / 2B 39.94 / 0.5B 37.47
- 试点研究(Qwen-1.8B 基座):多语联合训练 41.48 vs 最佳单语(Chinese)36.11 vs 基座 25.84 vs 权重平均 33.54
- proxy-tuning:免训练把 Apollo 的医疗能力注入更大通用模型(论文宣称)
- ApolloCorpora:2.5B tokens 十类构成(Web 886.7M 最大);Exams 类 78.0M 与评测题同源不同用
- 摘要 “6.1 billion” = 六语言覆盖的全球人口(非 token 数,勿与 2.5B 混淆)
- 论文实验口径题量 17,326(= 21,326 − 4,000 条 not used 中文题;存照⑧)
- 题干长度实测(均值/中位/P90/最长,字符):en 230/85/718/4,671;zh 34/18/87/277;fr 114/105/163/359;es 144/98/310/1,351;ar 97/54/246/1,315;hi 232/92/635/2,612
- zh 多选题 62 条的选项数分布:五选项 60 条 + 四选项 2 条(单选/多选与选项数为正交维度)
- cmexam 2,000 题的四分拆解:71 四选项单选 + 2 四选项多选 + 1,867 五选项单选 + 60 五选项多选
- 多字母答案值分布居前:(ABCDE) 8 条 / (ACE) 7 条 / (ABCD) 5 条 / (ABCE) 5 条 / (ABC) 5 条
- 英语文库题干长度双峰:MedMCQA 短干峰 + MedQA-USMLE 长案例尾(中位 85 vs P90 718)
- 阿/印地语切片存在跨语言双生题:同一 MMLU 底层题在 ar 与 hi 各有一份译文(附录 G 实录)
术语表(27 条)
| 术语 | 释义 |
|---|---|
| MCQA | Multiple-Choice Question Answering,多选题问答;XMedBench 全库唯一的任务形态(四选项单选为主) |
| USMLE | United States Medical Licensing Examination,美国执业医师资格考试;MedQA-USMLE 题源 |
| MCMLE | 中国医师资格考试(Medical Chinese Medical Licensing Examination 惯用缩写);MedQA-MCMLE 为其风格题库 |
| MedQA | Zhang et al. 2018 的医学考试题集,含 USMLE 与 MCMLE 两个语言分支 |
| MedMCQA | 印度 AIIMS/NEET-PG 医学入学考试题库(Pal et al. 2022),英语切片最大上游 |
| MMLU | Hendrycks et al. 2020 的跨学科知识基准;本条目取其医学 6 子类 |
| CMMLU | Li et al. 2023a 的中文本土知识测评,含中医等中国特有子目录 |
| CMB | Chinese Medical Benchmark(FreedomIntelligence 出品),single 部分被抽样 2,000 题入库 |
| CMExam | 中国执业医师考试题库,被抽样 2,000 题入库;62 条多选题的唯一来源 |
| HEAD-QA | 西班牙医疗系统专业考试题库(Vilares & Gómez-Rodríguez 2019),西语切片全部来源 |
| FrenchMedMCQA | 法语医学 MCQA 集(Labrak et al. 2023a;论文拼写 FrenMedMCQA),321 题 |
| MMLU_Arabic / MMLU_Hindi | FreedomIntelligence 维护的 MMLU 阿语/印地语翻译数据集(2023-08,MIT),阿/印地切片的翻译件来源 |
| Apollo | FreedomIntelligence 的轻量多语医疗 LLM 家族(0.5B/1.8B/2B/6B/7B),本基准的首批被测对象 |
| ApolloCorpora | Apollo 的训练语料(2.5B tokens,十类构成),与 XMedBench 构成训-测姊妹对 |
| proxy-tuning | 免训练迁移方法:把小模型微调前后的输出分布差叠加到大模型上(论文第二贡献) |
| Med-PaLM2 | Google 的医疗 LLM(Singhal et al. 2023);XMedBench 的 MMLU 子类选择与 4-options 惯例跟随其方法 |
| zero-shot | 零样本评测:不给示例直接作答;官方 prompt 模板即零样本单轮格式 |
| data contamination | 数据污染:评测题混入训练语料导致分数虚高;姊妹对的开放审计点(坑 8) |
| AI-Ready | 数据无需清洗即可被 AI 管线消费的就绪度;DAIMS 五维(可发现/可获取/可互操作/元数据/可持续)是其评估框架 |
| gated | HF 数据集访问控制机制;XMedBench gated=false 即无门槛直取 |
| hf-mirror | HF 大陆镜像站,resolve 端点与原站同路径;需 -L 跟随重定向(坑 4) |
| Croissant | 数据集机器可读元数据标准(mlcroissant 库支持),HF 为托管数据自动生成 |
| MIR/PIR/EIR/FIR/BIR/QUIR | 西班牙专科准入考试六类缩写(医学/心理学/护理/药学/生物学/化学),HEAD-QA 的题源体系 |
| ar5iv | arXiv 论文的 HTML 全文渲染服务,本条目论文侧数字(Table 2/3、试点表)的转录来源 |
| 跨语言双生题 | 同一底层题在多个语言切片中各有一份文本(如 MMLU 医学题在 ar/hi 各一份译文,附录 G 实录) |
| 源级伪影 | 上游数据自带的格式痕迹(如西语选项双句点 “Colágeno…”),清洗逻辑需容忍而非误报 |
| 许可穿透 | 汇编层宽松许可(Apache-2.0)不消除上游许可义务(如 HEAD-QA 层 CC BY 4.0 的署名要求随再分发传递) |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目 slug | xmedbench |
| 显示名 | XMedBench |
| HF repo id | FreedomIntelligence/XMedbench(b 小写) |
| 论文 | arXiv:2403.03640(v6 2024-10-12) |
| 团队 | FreedomIntelligence(CUHK-Shenzhen + SRIBD) |
| 总量 | 21,326 题(六语言) |
| 许可 | Apache-2.0 |
| 体量 | 33.4 MB / 19 文件 |
| 获取 | HF 直链 / hf-mirror / huggingface-cli |
| 发布 | 公告 2024-02-12;HF 上架 2024-03-06 |
| 最后维护 | 2025-02-15 |
| 抓取时点 | 2026-09-30 |
| 库内互链 | apollocorpus(718) / medmcqa(111) / cmb-cmexam(180) / headqa(120) |
| DAIMS 综合评级 | 7.2/10(中上;五维拆解见 §10.2) |
| 本条目规模 | 约 1,400 行;FAQ 32 问;硬事实清单 36 条 |
附录 B:逐项证据链自证
| 关键数字/陈述 | 来源 | 位置 |
|---|---|---|
| 21,326 总量与六语言计数 | 六个 test/{lang}.json 逐条解析 |
本地实测 2026-09-30 |
| 六语言 source 分布 | 同上 | 同上 |
| 选项数分布与 62 条多选题 | 同上(zh 文件交叉表) | 同上 |
| en answer 分布 (A)2,107… | 同上(Counter 计数) | 同上 |
| usedStorage 33,383,744 B | hf-mirror API usedStorage 字段 |
API 实抓 2026-09-30 |
| createdAt/lastModified | hf-mirror API 时间戳字段 | 同上 |
| downloads 243 / likes 14 | hf-mirror API 计量字段 | 同上 |
| gated=false / Apache-2.0 | API cardData + tags | 同上 |
| 构成表与 MMLU 6 子类清单 | HF README(3,787 字节全文实抓) | Data 区块 |
| “not used, randomly sample 2000” | 同上 | ZH 行原文 |
| PubMedQA 弃用原因 | 同上 | EN 区块原文 |
| HI/AR 链接互换 | 同上 vs 论文脚注 | Data 区块 vs 论文 |
| 官方时间线五则 | GitHub README Update 区块(经 HF README 转录核对) | Update 区块 |
| BibTeX 与 10 作者 | HF README 引用块 | 引用区 |
| Table 3 全部分数 | ar5iv v6 HTML 全文实抓 | 论文 §Results |
| 试点研究表(单语 vs 联合) | 同上 | 论文 §Training |
| ApolloCorpora 十类 token 构成 | 同上 | 论文 Table 2 |
| “6.1 billion population” | 同上 | 论文摘要 |
| “make a compromise” | 同上 | 论文 §Data |
| proxy-tuning 宣称 | 同上 | 论文 §Results/Discussion |
附录 C:数据获取决策树
需求是什么?
├── 跑多语言医疗评测(最常见)
│ └── 下载 test/*.json 六件 → 按 §6.2 解析 → 全量 21,326 或论文口径 17,326
├── 复现 Apollo 论文 Table 3
│ ├── 数据:test/ 过滤(坑 5:中文只取 medqa-mcmle+cmmlu-medical)
│ ├── Prompt:§3.4 模板(英语指令 + 六语言题面)
│ └── 判分:answer 字符串匹配(括号归一化)
├── 自建开放式评测
│ └── questions/*_question.json(纯题干)→ 自备选项与答案键
├── 一次性整包
│ └── XMedBench.zip(repo 根目录)
└── 训练模型
└── 走错了——去 ApolloCorpus(rid 718 / HF FreedomIntelligence/ApolloCorpus)
附录 D:answer 分布与题型实录
英语(7,327 题,全 4 选项单选):
| answer | (A) | (B) | © | (D) |
|---|---|---|---|---|
| 题数 | 2,107 | 1,850 | 1,708 | 1,662 |
法语(321 题,全 5 选项单选):
| answer | (A) | (B) | © | (D) | (E) |
|---|---|---|---|---|---|
| 题数 | 48 | 73 | 85 | 72 | 43 |
中文题型交叉表(8,759 题;单选/多选与选项数为两个正交维度):
| source | 4 选项单选 | 4 选项多选 | 5 选项单选 | 5 选项多选 | 小计 |
|---|---|---|---|---|---|
| medqa-mcmle | 3,426 | 0 | 0 | 0 | 3,426 |
| cmb-single | 0 | 0 | 2,000 | 0 | 2,000 |
| cmexam | 71 | 2 | 1,867 | 60 | 2,000 |
| cmmlu-medical | 1,333 | 0 | 0 | 0 | 1,333 |
| 合计 | 4,830 | 2 | 3,867 | 60 | 8,759 |
读表三则:其一,"XMedBench 全四选项"的口径只在 en/es/ar/hi 成立,中文(混合 4/5 选项)与法语(全 5 选项)切片例外;其二,62 条多字母答案全部集中在 cmexam(60 条五选项 + 2 条四选项),答案值分布以 (ABCDE) 8 条、(ACE) 7 条、(ABCD) 5 条、(ABCE) 5 条、(ABC) 5 条居前——判分器若只认 (A)-(E) 单字母,这 62 条会被静默判错;其三,cmb-single 全部为 5 选项单选——对"四选项统一"宣称做中文实验时,这两个例外都要写进实验说明。
附录 E:复现论文口径的过滤骨架(代码)
import json
# 论文 Table 3 九个评测列对应的 source 过滤器(坑 5 的代码化)
paper_columns = {
"test/en.json": {"medqa-usmle", "medmcqa", "mmlu-medical"},
"test/zh.json": {"medqa-mcmle", "cmmlu-medical"}, # 排除 not used 的 4,000 题
"test/fr.json": {"frenchmedmcqa"},
"test/es.json": {"headqa"},
"test/ar.json": {"mmlu-medical-ar"},
"test/hi.json": {"mmlu-medical-hi"},
}
records = []
for path, keep in paper_columns.items():
with open(path, encoding="utf-8") as f:
records += [r for r in json.load(f) if r["source"] in keep]
assert len(records) == 17_326, f"论文口径应为 17,326,实测 {len(records)}"
# 全基准口径(21,326)则不过滤,直接读全部六文件求和
附录 F:检索路径示范
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 本基准 | “XMedBench” OR “XMedbench”(两种大小写都试) | HF 数据集页 / arXiv:2403.03640 |
| 论文 | “Apollo” AND “multilingual medical” AND “6B” | arXiv:2403.03640(v1-v6) |
| 训练语料 | “ApolloCorpus” OR “ApolloCorpora” | HF FreedomIntelligence/ApolloCorpus / 库内 rid 718 |
| 上游英语题源 | “MedQA-USMLE-4-options” OR “MedMCQA” | 库内 rid 111 及上游 HF |
| 上游中文题源 | “CMB” AND “Chinese Medical Benchmark” OR “CMExam” | 库内 rid 180 及上游 |
| 上游西语题源 | “HEAD-QA” AND “Spanish” | 库内 rid 120 及上游 |
| 翻译件 | “MMLU_Arabic” OR “MMLU_Hindi” AND FreedomIntelligence | 两个翻译数据集(MIT) |
| 法语上游 | “FrenchMedMCQA” OR “FrenMedMCQA”(两种拼写) OR “qanastek” | qanastek/frenchmedmcqa |
检索卫生两条:一、凡检索本基准,先试小写 b 的 XMedbench 再试大写 XMedBench——HF 内部 id 是前者;二、凡引用分数,同时锚定论文版本号(本条目主表出自 v6)与数据 lastModified(2025-02-15),双锚定可避免版本漂移争议。
附录 G:六语言样例题实录(每语言一条,数据原样)
以下六条样例从各自语言文件中按"代表性题源的第一条"规则抽取(2026-09-30 本地实测),原文照录、不做任何清洗——用于直观感受六语言的数据形态与翻译件质量。
英语(medqa-usmle,4 选项,答案 (B),临床推理长题干代表):
question: "A junior orthopaedic surgery resident is completing a carpal tunnel
repair with the department chairman as the attending physician. During the
case, the resident inadvertently cuts a flexor tendon. ..."
options: (A) Disclose the error to the patient and put it in the operative report.
(B) Tell the attending that he cannot fail to disclose this mistake.
(C) Report the physician to the ethics committee.
(D) Refuse to dictate the operative report.
answer: (B) source: medqa-usmle
中文(medqa-mcmle,4 选项,答案 (D),短题干应试型代表):
question: "经调查证实出现医院感染流行时,医院应报告当地卫生行政部门的时间是"
options: (A) 2小时. (B) 4小时内. (C) 12小时内. (D) 24小时内.
answer: (D) source: medqa-mcmle
法语(frenchmedmcqa,5 选项,答案 ©,"陈述判别"句式代表):
question: "Parmi les propositions suivantes, indiquer celle qui est exacte.
Dans les conditions physiologiques, le pH le plus élevé est mesuré dans:"
options: (A) Le suc gastrique. (B) La bile vésiculaire. (C) Le suc pancréatique.
(D) La salive. (E) Les sécrétions intestinales.
answer: (C) source: frenchmedmcqa
西班牙语(headqa,4 选项,答案 (B),注意选项尾部的双句点伪影):
question: "Forma fibras extracelulares con gran resistencia a la tensión:"
options: (A) Fibronectina.. (B) Colágeno.. (C) Integrinas.. (D) Proteoglucanos..
answer: (B) source: headqa
阿拉伯语(mmlu-medical-ar,4 选项,答案 (A),MMLU 翻译件代表;与印地语样例同源):
question: "ما هي الأعراض المتأتية عن ضغط الأعصاب الوجهية في فتحة الكعبرة الرأسية؟"
options: (A) شلل عضلات الوجه المتأرجحة في الجانب الأيمن
(B) شلل عضلات الوجه وفقدان الذوق.
(C) شلل عضلات الوجه وفقدان الذوق ودمع.
(D) شلل عضلات الوجه وفقدان الذوق والدمع وانخفاض اللعاب.
answer: (A) source: mmlu-medical-ar
印地语(mmlu-medical-hi,4 选项,答案 (A),翻译质量观察样本):
question: "स्टाइलोमास्टोइड फोरमेन में उपरोक्त मुख पेशी की दबाव उत्पन्न करने वाली
गांठ जो सामान्यतः होती है उससे यह संबधित पक्ष दूसरे वाले"
options: (A) मुख के इस्पात शिरों का लक्ष्यहीन हो जाना।
(B) मुख के इस्पात शिरों का लचीलापन और टेस्ट का नुकसान।
(C) मुख के इस्पात शिरों का लचीलापन, टेस्ट का नुकसान और आँसू निकलना।
(D) मुख के इस्पात शिरों का लचीलापन, टेस्ट का नुकसान, आँसू निकलना और थूक बन जाना।
answer: (A) source: mmlu-medical-hi
三条样例外的读审观察(本条目作者基于上表原文的直接观察,供使用者自行验证):
- 印地语翻译件存在可直读的术语错译:样例题的正确语义应为"面肌瘫痪、味觉丧失、流泪、唾液减少"(对照 §2.2 英语样例的同一底层题),而印地语译文中"面部肌肉"作 “मुख के इस्पात शिरों”(字面近似"面部的钢静脉"——इस्पात=钢、शिरा=静脉)、“味觉"作 “टेस्ट”(英语 taste 的音译"测试”)。机器翻译痕迹与术语质量风险在数据层面可以直接观察到——这不是推断,是原文(§3.5 的"三重风险"由此有了实物证据)。
- 跨语言双生:阿拉伯语样例与印地语样例是同一道 MMLU 底层题的两份翻译(且即 §2.2 字段规格表中英语样例的同源题)——三份文本、一个知识点。做跨语言知识追踪或去重分析时这是现成的对齐锚点,做"独立多语言证据"统计时这是需要排除的重复计数。
- 西语选项的双句点伪影(“Colágeno…”):HEAD-QA 源数据自带的标点痕迹在 XMedBench 版中被原样保留——基于标点的清洗与解析逻辑要容忍这类源级伪影。
附录 H:本条目的实测方法与可复现脚本
本条目全部数据侧硬数字出自同一段统计脚本(六语言文件逐一解析),脚本原样附下——复现本条目任何数据侧数字只需三步:下载(§6.1)、落盘、运行:
#!/usr/bin/env python3
"""xmedbench_audit.py — XMedBench 六语言数据审计(本条目实测口径)"""
import json, re, statistics
from collections import Counter
FILES = { # 下载自 hf-mirror resolve 端点(-L 跟随重定向,2026-09-30)
"en": "test_en.json", "zh": "test_zh.json", "fr": "test_fr.json",
"es": "test_es.json", "ar": "test_ar.json", "hi": "test_hi.json",
}
def n_options(rec): # 选项数:数 options 内以 ( 开头的行
return len([l for l in rec["options"].split("\n") if l.strip().startswith("(")])
def ans_letters(rec): # 答案字母:提取 ( ) 内的全部大写字母
return "".join(re.findall(r"[A-Z]", rec["answer"]))
total, report = 0, {}
for lang, fname in FILES.items():
recs = json.load(open(fname, encoding="utf-8"))
total += len(recs)
qlens = sorted(len(r["question"]) for r in recs)
report[lang] = {
"rows": len(recs),
"sources": dict(Counter(r["source"] for r in recs)),
"options": dict(Counter(n_options(r) for r in recs)),
"multi_answer": sum(1 for r in recs if len(ans_letters(r)) > 1),
"q_len_mean": round(statistics.mean(qlens)),
"q_len_median": qlens[len(qlens) // 2],
"q_len_p90": qlens[int(len(qlens) * 0.9)],
"q_len_max": max(qlens),
"answers": dict(Counter(r["answer"] for r in recs)),
}
print(json.dumps(report, ensure_ascii=False, indent=2))
print("TOTAL:", total) # 预期 21326
# 预期关键断言(任一失败即版本漂移,先停下核对再写报告):
# report["en"]["sources"] == {"medmcqa":4183,"mmlu-medical":1871,"medqa-usmle":1273}
# report["zh"]["multi_answer"] == 62 且多选全在 cmexam
# report["fr"]["options"] == {5:321};report["es"]["options"] == {4:2742}
方法学声明三条:其一,所有"实测"字样的数字均来自上述脚本对 2026-09-30 下载数据的运行,脚本与数据均已存档于本条目工作目录的 FACTS 流程;其二,论文侧数字(Table 3、Table 2、试点表)来自 ar5iv v6 HTML 全文的表格转录,转录误差风险已通过交叉求和(六列均值与总平均对账)控制;其三,HF API 元数据(时间戳、计量、许可 tags)来自 hf-mirror API 的单次抓取——这类数字随时间变动,引用时以你的抓取时点为准,不要照抄本条目。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 Apollo 论文(arXiv:2403.03640,v6 实抓)、HF/hf-mirror API 实测、六个语言 JSON 文件逐条解析与 HF README 全文为源;发布日双口径、作者数双口径、大小写三态、HI/AR 链接互换、es 选项数筛选、zh 混合题型等八项存照已在 §10.3 逐条列明。条目与库内 ApolloCorpus(rid 718)、MedMCQA(rid 111)、CMB-CMExam(rid 180)、HeadQA(rid 120)互链,构成"多语言医疗评测"语义下从训练语料到评测基准、从上游题源到统一考卷的完整检索面。维护触发点:HF repo 出现新 commit、论文 v7 或更高版本、ApolloMoE 系评测结果发布——三者任一发生时应复核 §4 分数表与 §7.1 时间线。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- medqa — 共享标签:医学问答与基准 / 医学问答 / 医学考试 / 评测基准
- medmcqa — 共享标签:医学问答与基准 / 医学问答 / 医学考试 / 评测基准
- cmb-cmexam — 共享标签:医学问答与基准 / 医学问答 / 医学考试 / 评测基准
- headqa — 共享标签:医学问答与基准 / 医学问答 / 医学考试
- healthsearchqa — 共享标签:医学问答与基准 / 医学问答 / 评测基准
- claimify — 共享标签:医学问答与基准 / 医学问答 / 评测基准
- pubmedqa — 共享标签:医学问答与基准 / 医学问答 / 评测基准
- medicationqa — 共享标签:医学问答与基准 / 医学问答 / 评测基准
- medcalc-bench — 共享标签:医学问答与基准 / 医学问答 / 评测基准
- apollocorpus — 共享标签:医学问答 / 医学考试 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

