信息速览
INFOBOX — ApolloCorpus 一屏速览
维度 内容 本质 面向"60 亿人口"的六语言医疗 LLM 预训练+SFT 混合语料:九类医疗文本+四类通用文本,叠加 QA-Augmented 扩展 团队 深圳大学 FreedomIntelligence 团队,通讯 Benyou Wang;论文 12 作者 论文 arXiv:2403.03640《Apollo: Lightweight Multilingual Medical LLMs toward Democratizing Medical AI to 6B Population》(v1 2024-03-06 → v6 2024-10-12) 数据 3,741,196 条文档;HF 口径 22.3GB(下载实测约 36.5GiB);预训练部分约 2.5B tokens(Tab.2 精确合计 2,536.3M) 构成 医疗六类 1,245.7M tokens(Books 413.8M/Papers 349.0M/Encyclopedias 226.2M/Dialogues 149.1M/Exams 78.0M/Guidelines 29.6M)+ 通用四类 1,290.6M(Web 886.7M/General 364.9M/Math 22.6M/Code 16.4M) 语言 医疗部分六语言(en/zh/es/fr/pt/hi);medicalWiki_hi 仅 209 行(极不均衡,坑 5) 方法 QA-Augmented Pre-training(ChatGPT 逐文档改写问答)+ Priority sampling(π(PT)=16/π(SFT)=2) 上游 PMC-Patients、HuatuoGPT、Huatuo_26M、MAQA、CMB、ShareGPT、Alpaca、WizardLM、belebele、ai2_arc、Capybara 模型家族 Apollo 0.5B/1.8B/2B/6B/7B(后续扩至 34B/72B)+ MedJamba(2024-04)+ ApolloMoE(2024-10) 核心结果 Apollo-7B 于 XMedBench 平均 58.78(基座 Gemma-7B 52.44,+6.34);同期 GPT-4 73.37、GPT-3.5 57.80 获取 HF load_dataset("FreedomIntelligence/ApolloCorpus")公开直链;GitHub ApolloCorpus.zip / 0.download_data.sh许可 Apache-2.0 库内互链 medmcqa(111)、headqa(120)、cmb-cmexam(180)、meddialog(210)、pmc-oa(320)、s2orc(370)
ApolloCorpus 是一个"把医疗大模型做成六国语言公共品"的数据工程:深圳大学 FreedomIntelligence 团队围绕"让医疗 AI 覆盖全球 60 亿人口"的目标,汇集书籍、论文、百科、对话、考试、指南九类医疗文本与网络、通用、数学、代码四类通用文本,共 3,741,196 条文档、约 2.5B tokens,并首创 QA-Augmented Pre-training——用 ChatGPT 把每篇文档改写成问答对、再按 Priority sampling 加权混入训练流,训练出 0.5B 到 72B 的 Apollo 模型家族。它是开源世界里少见的"数据+方法+模型+基准"四位一体医疗 LLM 工程,Apache-2.0 直链可取。
导语读法三则:
- 只想下数据:直奔 §7 获取与许可——HF
load_dataset一行可取,Apache-2.0 无请求制;注意 22.3GB 与 36.5GiB 双口径(坑 4)。 - 关心预训练方法:直奔 §4 QA-Augmented Pre-training 与 §3.3 Priority sampling——"每篇文档额外生成问答对再预训练"是本文方法论卖点。
- 做多语言医疗评测:直奔 §6 XMedBench 与 Apollo-7B 结果对照——六语言医疗考试基准与 GPT-4 的差距表可直接对标。
§0 导读:这个数据集解决什么问题
医疗大语言模型的能力上限,从来不只是模型架构问题,更是数据问题。2023 年前后,英文医疗 LLM(Med-PaLM、MedAlpaca、HuatuoGPT 等)快速迭代,但两个结构性缺口始终没有填补:一是语言缺口——绝大多数高质量医疗语料是英文,中文尚有 CMB/CMExam 一线资源,西班牙语、法语、葡萄牙语、印地语几乎荒芜,而这恰恰是全球人口最多的语言集合;二是方法缺口——预训练语料普遍"文档进、文档出",医疗知识以陈述式段落存在,与下游"患者问、医生答"的问答形态存在格式鸿沟。
ApolloCorpus(论文中称语料合集为 ApolloCorpora)对这两个缺口各给出一个回答。对语言缺口:它把医疗文本按英语、中文、西班牙语、法语、葡萄牙语、印地语六种语言系统收集——这六种语言的母语人口恰好约 60 亿,对应论文标题里的"to 6B Population"。对方法缺口:它提出 QA-Augmented Pre-training,让 ChatGPT 把每篇文档改写成若干问答对,把"陈述式知识"转译成"问答式知识",并配以 Priority sampling 策略(问答扩展的采样权重远高于原文),保证改写后的问答形式在训练流中占主导。
最终产物是三层资产:数据层是 3,741,196 条文档的 ApolloCorpus;模型层是从 0.5B 到 7B 的轻量级 Apollo 家族(后续扩展 34B/72B,并衍生 MedJamba、ApolloMoE 两个变体);基准层是覆盖六语言的 XMedBench 医学考试基准。Apollo-7B 在 XMedBench 上平均 58.78 分,比基座 Gemma-7B 的 52.44 高 6.34 分,且以约 1/10 的参数量在多语言医疗场景与 GPT-3.5(57.80)打平——"轻量模型+精心构型数据"路线的代表性证据。
§0 读法三则:
- 这个条目是"语料+方法+模型家族+基准"四合一:本体是 ApolloCorpus 语料,方法卖点是 QA-Augmented Pre-training,下游是 Apollo 模型家族,配套是 XMedBench——四者都 Apache-2.0 开放,但检索名各不相同(语料单数 ApolloCorpus、论文合集复数 ApolloCorpora,坑 1)。
- 全文统计数字均出自论文正文与表格、HF 数据卡与 GitHub README 的一手核验(核验时点 2026-09-28,经 hf-mirror.com API);已知漂移处(体积 22.3GB vs 36.5GiB、发布日期 02-12 vs 03-06、作者拼写等)已分别在坑 3、坑 4、坑 2 存照。
- "六语言"是医疗部分口径:通用文本(Web/General/Math/Code)基本为英文,medicalWiki_hi 仅 209 行——做多语言采样前务必读 §2.3 与坑 5。
§1 数据集速览:十问十答
Q1:ApolloCorpus 到底是什么、谁做的?
深圳大学 FreedomIntelligence 团队(通讯作者 Benyou Wang)发布的医疗大语言模型预训练+SFT 混合语料,共 3,741,196 条文档。它是 Apollo 系列工作(arXiv:2403.03640)的数据基座:同一个团队用这批语料训练了 0.5B-7B 的 Apollo 模型家族,并配套发布了 XMedBench 评测基准。HF 数据卡名叫 ApolloCorpus(单数),论文里把语料合集称作 ApolloCorpora(复数)——两个名字指同一批数据(坑 1)。
Q2:"六语言"具体指什么、覆盖多广?
英语、中文、西班牙语、法语、葡萄牙语、印地语六种,选择标准是母语人口合计约 60 亿。六语言覆盖主要体现在医疗文本部分:medicalWiki 等多语言子集按语言切分 split。但覆盖极不均衡——印地语切片 medicalWiki_hi 仅 209 行,而英文类目体量大得多;通用文本部分基本为英文(坑 5、坑 9)。
Q3:规模到底多大?
三个口径:行数 3,741,196 条文档(HF API 实测);体积 HF 数据卡写 22.3GB,下载文件夹实测约 36.5GiB(十进制/二进制与压缩态差异,坑 4);tokens 预训练部分约 2.5B(论文 Tab.2 十类精确合计 2,536.3M)。做管线规划时以 40GB 磁盘余量、2.5B tokens 为准。
Q4:语料由哪些类别构成、各占多少?
预训练部分十类(Tab.2):Web 886.7M tokens、Books 413.8M、General 364.9M、Papers 349.0M、Encyclopedias 226.2M、Dialogues 149.1M、Exams 78.0M、Guidelines 29.6M、Math 22.6M、Code 16.4M。其中医疗核心六类(Books/Papers/Encyclopedias/Dialogues/Exams/Guidelines)合计约 1,245.7M tokens,约占总量的 49%;其余为通用文本配比(详见 §2.1 与 §2.2 的全表)。
Q5:QA-Augmented Pre-training 是什么?
本工作首创的预训练增强方法:对语料中每篇文档,用 ChatGPT 生成若干"问答对"——把文档内容转译成患者/学生视角的提问与对应回答,形成该文档的 QA 扩展版本;预训练时原文档与 QA 扩展一起进入训练流。动机是弥合"陈述式文档"与"问答式使用场景"之间的格式鸿沟(详见 §4)。
Q6:Priority sampling 是什么?
QA 扩展与原文的配比策略:预训练数据中文档原文采样概率基数 1、其 QA 扩展权重 π(PT)=16;SFT 数据中 QA 权重 π(SFT)=2。也就是说,一篇文档被改写出的问答内容,在训练流中出现的频率是原文的 16 倍——这是"问答形式主导训练"的量化保障(详见 §3.3)。
Q7:上游数据从哪来?
两条线。医疗文本线:PubMed 文献、医学书籍、医学百科、医患对话(含 MedDialog 类资源)、医学考试题库、临床指南,以及 PMC-Patients、HuatuoGPT、Huatuo_26M、MAQA、CMB 等开源数据集。通用文本线:网页、通用语料、数学、代码,以及 ShareGPT、Alpaca、WizardLM、belebele、ai2_arc、Capybara 等开源混合集(详见 §3.1)。
Q8:用这批语料训练出的模型表现如何?
Apollo-7B(基座 Gemma-7B)在六语言医学考试基准 XMedBench 上平均 58.78,比基座的 52.44 高 6.34;同期 GPT-4 为 73.37、GPT-3.5 为 57.80——轻量级模型在多语言医疗场景追平 GPT-3.5。家族内 0.5B/1.8B/2B/6B/7B 各档相对各自基座均有提升(详见 §6.2)。
Q9:我现在能拿到什么、什么许可?
三条获取路径全部公开直链:HuggingFace load_dataset("FreedomIntelligence/ApolloCorpus");GitHub 仓库的 ApolloCorpus.zip;仓库内 0.download_data.sh 一键下载脚本。许可为 Apache-2.0,无请求制、无注册门槛(详见 §7)。
Q10:为什么它对 AI-Ready 重要?
它是医疗文本语料里"数据-方法-模型-基准"闭环最完整的开源样本:数据 Apache-2.0 直链即用(可及性满分档),QA-Augmented 方法给出了"文档→问答"的可复制管线,模型家族提供了可直接对比的基线,XMedBench 提供了六语言评测入口。对想构建非英文医疗 LLM 的团队,这是一份"从数据到评测"的完整参考实现(详见 §7.3 与 §8.3)。
§2 身份与团队:FreedomIntelligence 的多语言医疗版图
2.1 团队与机构
ApolloCorpus 出自 FreedomIntelligence(自由智能团队)——一个挂靠香港中文大学(深圳)(The Chinese University of Hong Kong, Shenzhen)与深圳大数据研究院(Shenzhen Research Institute of Big Data)的医疗 AI 研究组。团队在此前数年已构建了一条中文医疗 AI 数据流水线:CMB(中文医疗基准)、CMB-Exam、HuatuoGPT 系列的合作数据等;ApolloCorpus 是该团队从中文/双语走向"六语言全球化"叙事的转折点,也是其第一次把预训练级语料整体开源。
论文署名 12 人(arXiv abs v6 一手):Xidong Wang、Nuo Chen、Junying Chen 三人为共同一作(论文页脚声明前三作者同等贡献,且注明 Benyou Wang 为通讯作者,wangbenyou@cuhk.edu.cn),其后依次为 Yidong Wang、Guorui Zhen、Chunxian Zhang、Xiangbo Wu、Yan Hu、Anningzhe Gao、Xiang Wan、Haizhou Li、Benyou Wang。注意两个署名细节:第一作者 Xidong Wang 同时是论文提交者;作者名 Junying Chen 在 arXiv abs 页拼作 “Junyin Chen”,HTML 正文拼作 “Junying Chen”——后者与团队其他项目署名一致(坑 6)。
团队后续的演化路线在 GitHub 时间线上清晰可见:2024.04.25 发布 MedJamba(把医疗配方嫁接到 Jamba 架构),2024.10.15 发布 ApolloMoE(混合专家版,宣称覆盖 50 种语言)——ApolloCorpus 的"六语言"版图在一年内扩张了近十倍语言数,但那个 50 语言的后续工作没有再以同等深度开源预训练语料,ApolloCorpus 至今仍是团队最完整的一次数据公开。
2.2 论文与版本时间线
| 日期 | 事件 | 依据 |
|---|---|---|
| 2024-01-23 | Apollo GitHub repo 发布 | README 时间线 |
| 2024-02-12 | ApolloCorpus 与 XMedBench 发布(README 口径) | README 时间线(HF repo createdAt 实为 2024-03-06,坑 7) |
| 2024-03-06 11:56 UTC | arXiv:2403.03640 v1 提交(14,155 KB) | arXiv 提交史 |
| 2024-03-06 13:03 UTC | HF 数据集 repo 创建 | HF API createdAt |
| 2024-03-07 | README 记 “Paper released” | README 时间线 |
| 2024-03-09 / 06-28 / 08-16 / 09-14 | arXiv v2/v3/v4/v5 | arXiv 提交史 |
| 2024-04-25 | MedJamba 发布 | README 时间线 |
| 2024-09-13 | HF 数据集最后一次修改 | HF API lastModified |
| 2024-10-12 | arXiv v6(当前版,标题定稿 “A Lightweight”) | arXiv 提交史 |
| 2024-10-15 | ApolloMoE repo 发布(50 语言) | README 时间线 |
论文标题本身有一段小进化史:v1/v4 HTML 时期写作 “An Lightweight…”(语法瑕疵),v6 定稿为 “A Lightweight…”,而团队自己 README 里的 BibTeX 建议条目干脆写成 “Lightweight…”(无冠词)——三个口径并存,引用时以 arXiv abs 页当前版为准(坑 6)。论文状态截至抓取(2026-09-28)仍标注 Preprint,未检索到期刊正式发表版(待核 T2)。
2.3 命名:Apollo 与 “6B People”
模型名 Apollo 取自希腊神话中司掌医药、瘟疫、太阳与光明的神祇——论文原话解释为"symbolizes the democratization of medical LLMs to 6 billion people, illuminating global healthcare"。标题中的 “6B People” 指六种语言的母语/使用人口合计约 61 亿(论文脚注:按 Wikipedia 语言人口列表与国家人口列表口径,覆盖 132 个国家和地区)——注意这是"语言覆盖人口"而非"模型参数 6B",6B 恰好又是 Apollo 模型系中的一个规模档(Apollo-6B),检索时极易混淆。
§3 数据本体:行数、字节数与 token 账本
3.1 三套规模口径,一次说清
ApolloCorpus 的"大小"有三个常被混用的数字,先对齐口径:
| 口径 | 数值 | 来源 | 何时用 |
|---|---|---|---|
| 行数 | 3,741,196 rows | HF 页面快照(pretrain_text config,13 splits) | 引用"多少条记录"时 |
| 文件大小 | 22.3 GB | HF 页面 Total file size | 引用"下载多大"时 |
| 存储占用 | 39,147,380,685 B ≈ 36.5 GiB | HF API usedStorage | 核算 HF 仓库真实占用(含 zip 整包与 LFS 全部文件,与页面口径不同,坑 3) |
| token 量 | 2.5B tokens(Tab.2 分项合计 2,536.3M) | 论文一手 | 引用"多少训练 token"时 |
补充元数据(HF API 一手,抓取时点 2026-09-28):downloads 1,242(API 实时;页面快照另一时点 1,529)、likes 41、size_categories 1M<n<10M、format json、modality text、license tag apache-2.0、关联论文 tag arxiv:2403.03640、gated false、private false。引用数背景:Google Scholar 显示被引 71(2026-09-28 快照),arxiv.gg 显示 Cited by 19(不同口径)——引用数不作为本条目硬数字。
3.2 论文 Tab.2:token 账本(一手表格原样转录)
这是全数据集最有信息量的一张表——每一类数据在每种语言里的 token 配比,精确到 0.1M:
| 数据源 | 训练阶段 | 语言(token) | 合计 |
|---|---|---|---|
| Web(网络医疗内容,专业外入口) | Continue Pretrain | EN 499.9M, ZH 329.3M, ES 57.5M | 886.7M |
| Books(医疗书籍) | Continue Pretrain | EN 296.7M, ZH 117.1M | 413.8M |
| General(通用指令) | Instruction Tuning | EN 194.5M, ZH 69.4M, HI 43.9M, FR 20.0M, AR 18.7M, ES 18.4M | 364.9M |
| Papers(医学论文) | Continue Pretrain | EN 252.9M, ZH 45.6M, ES 46.0M, FR 4.5M | 349.0M |
| Encyclopedias(医学百科) | Continue Pre-train | EN 221.1M, FR 4.6M, HI 0.5M | 226.2M |
| Dialogues(医患对话) | Continue Pretrain | EN 92.1M, ZH 46.6M, AR 10.4M | 149.1M |
| Exams(医学考试) | Instruction Tuning | EN 42.1M, ZH 35.3M, ES 0.5M, FR 0.1M | 78.0M |
| Guidelines(临床指南) | Continue Pretrain | EN 29.6M | 29.6M |
| Math(数学指令) | Instruction Tuning | EN 18.9M, ZH 3.7M | 22.6M |
| Code(代码指令) | Instruction Tuning | EN 9.2M, ZH 7.2M | 16.4M |
| 合计 | ≈2,536.3M ≈ 2.5B |
从这张表能读出四个结构性事实:
- Web 是最大单项(886.7M,占 35%)。作者刻意混入"专业外"网络医疗内容,理由是模拟医学生"核心课程之外的信息摄取",保持对互联网语体的适应力——代价是这部分内容质量最不可控(§8 使用注意)。
- 印地语与阿拉伯语在预训练侧近乎缺席:Encyclopedias-HI 仅 0.5M,Dialogues-AR 10.4M(且未随 HF 发布,见坑 2);两语言的真实支撑主要在 SFT 的 general 分片(HI 43.9M / AR 18.7M)。
- Instruction Tuning 合计 481.9M token(Exams 78.0 + General 364.9 + Math 22.6 + Code 16.4),占总量约 19%——这不是一个纯预训练语料,而是一份"预训练:指令 ≈ 4.3:1"的混合配方,与其 Mix Training 训练法互为表里。
- 语言配比高度不均:EN 全表合计 1,657.0M(65.3%),ZH 654.2M(25.8%),ES 122.4M(4.8%),HI 44.4M(1.8%),FR 29.2M(1.2%),AR 29.1M(1.1%)。所谓"六语言覆盖 61 亿人",落到 token 上是两个数量级的落差——使用时不应期待均衡的多语言覆盖(逐语言对账卡见附录 R)。
3.3 HF 发布结构:文件级清单(API siblings 一手)
HF 仓库发布两种取用形态:散文件(train/ 目录,与 datasets 库 config 对接)与整包(根目录 ApolloCorpus.zip,与论文复现脚本对接)。
预训练部分(config 名 pretrain_text,13 splits,viewer 行数口径):
| split | 行数 | split | 行数 |
|---|---|---|---|
| medicalPaper_en | 878k | medicalGuideline_en | 99.7k |
| medicalWeb_zh | 641k | medicalPaper_es | 89k |
| medicalWeb_en | 394k | medicalWiki_fr | 8.39k |
| medicalBook_en | 553k | medicalPaper_fr | 8.28k |
| medicalBook_zh | 500k | medicalWiki_hi | 209 |
| medicalWiki_en | 239k | medicalWeb_es | 153k |
| medicalPaper_zh | 177k |
每个数据源-语言组合在仓库里成对发布 _text.json(字符串列表)与 _qa.json(问答对嵌套列表)两个文件,例如 train/pretrain/medicalBook_en_text.json 与 train/pretrain/medicalBook_en_qa.json。注意 viewer 的 13 splits 只统计 _text 文件(config 只挂载 text),_qa 文件需另行取用——所以"3,741,196 行"只是预训练文本侧的口径,不含 qa 副本(坑 3)。
SFT 部分(无统一 config,散文件直取):code_en/code_zh、general_ar/general_en/general_es/general_fr/general_hi/general_zh、math_en/math_zh、medicalExam_en/medicalExam_es/medicalExam_fr/medicalExam_zh(另有 _clean/_dup/_dup_question 三个变体后缀文件,用于去重流程,见待核 T4)、medicalPatient_ar/medicalPatient_en/medicalPatient_zh。
把 HF 文件矩阵与论文 Tab.2 并排看,有一处结构性缺口:论文 Dialogues-AR 10.4M 继续预训练 token 在 HF 的 pretrain 目录找不到对应文件(pretrain 五语言 en/zh/es/fr/hi 不含 ar);阿拉伯语的实际发布落点是 SFT 的 general_ar.json 与 medicalPatient_ar.json。论文叙事(六语言全阶段覆盖)与发布实物(预训练五语言)之间的这段落差,是使用本语料做六语言预训练时最需要预知的现实(坑 2)。
3.4 数据格式样例
预训练 text 侧(list of string):
[
"string1",
"string2"
]
预训练 qa 侧与全部 SFT(问答对嵌套列表,平铺 q1,a1,q2,a2):
[
["q1", "a1", "q2", "a2"]
]
viewer 实拍(medicalWeb_zh 分片,p=312):一条中文网络医疗问答文本,讨论癌症晚期患者食欲不振的机制(5-羟色胺受体、NK-1 受体、化疗与阿片类药物副作用、促胃肠动力药等),字符串长度分布 32 至 34.7k 字符——可直观感受 medicalWeb 分片的"论坛体"质地:医学正确性与口语化并存。
§4 数据来源与处理:一条可复制的多语言医疗配方
4.1 数据从哪来(逐类逐语言溯源)
论文 §3.1 与附录 A 记录了每种数据的来源与清洗方式。与医生和医学生"充分沟通"(extensive communication)后,作者先锁定六类高质量医疗数据源,再补入网络内容与通用能力数据。逐类溯源如下:
| 类别 | 语言 | 来源(论文一手) |
|---|---|---|
| 医患对话 Dialogues | EN | 基于 PMC-Patients(Zhao et al. 2022)用 ChatGPT 构造多轮医患对话,论文 Fig.5 给出改写 prompt 模板(要求患者问题与医生回答"尽可能复杂详尽") |
| 医患对话 Dialogues | ZH | 直接采用 HuatuoGPT 数据集(Zhang et al. 2023)与 Huatuo_26M(Li et al. 2023b)的简化子集——团队自家前作资产复用 |
| 医患对话 Dialogues | AR | 从最大的阿拉伯医疗问答数据集 MAQA(Abdelhay and Mohammed 2022)抽取问答长度均 >128 的高质量对 |
| 医学百科 Encyclopedias | EN | 医学维基类文本,用 English Medical Dictionary 过滤出 36,107 个医学相关词条 |
| 医学百科 Encyclopedias | FR/HI | 同类百科来源(HI 仅 0.5M token,209 行) |
| 医学论文 Papers | EN/ZH/ES/FR | 生物医学论文文献(EN 252.9M 为最大论文分片;与 PMC 系语料同域,可对照库内 pmc-oa(320)、s2orc(370)) |
| 医学书籍 Books | EN/ZH | 医学教材与专著(EN 296.7M / ZH 117.1M) |
| 临床指南 Guidelines | EN | 临床实践指南(仅英文 29.6M——低资源语言几乎没有可用的开放指南语料) |
| 医学考试 Exams | EN/ZH/ES/FR | ZH 收集 CMB(Wang et al.)训练集等;EN 对应 USMLE 系考试题;ES/FR 少量(0.5M/0.1M) |
| Web | EN/ZH/ES | 在线医疗论坛与问答(论文注明 “medicalWeb (from online forum)”) |
| General | 六语言 | ShareGPT、Alpaca 原始数据;ZH 另加 GPT-4 按 WizardLM 方法(Xu et al. 2023)生成的数据;EN 另加 WizardLM、belebele(Bandarkar et al. 2023,多语言阅读理解)、ai2_arc(Clark et al. 2018,抽象推理)、Capybara(Daniele and Suphavadeeprasits 2023,指令遵循) |
| Math / Code | EN/ZH | 数学推理与代码指令(保持通用推理/编程能力,防止领域微调"变笨") |
值得注意的诚实细节:阿拉伯语对话数据的门槛是"问答长度均 >128 字符"——在极低资源场景下,作者选择"宁少勿短"的抽取策略;而印地语百科 0.5M token(HF 仅 209 行)则坦率暴露了印地语医学百科语料的匮乏程度。这两个数字放在一起,比任何叙述都更直观地呈现了"医疗 AI 民主化"的数据现实。
4.2 QA-Augmented Pre-training:为什么预训练数据长着一张问答脸
继续预训练(continued pre-training)领域有一个公认痛点:模型在"读书"(适应域内文本分布)的过程中会遗忘"答题"(指令遵循)能力,域适应与对齐两阶段互相拆台。ApolloCorpus 的应对是在数据侧而非训练侧解决:用 ChatGPT 把预训练文本批量改写成医患问答对,让"读书"的过程本身就携带问答格式。
论文的消融实验(Tab.4,Qwen-1.8B backbone)支持了这一设计:
| 设置 | 六语言平均 |
|---|---|
| 基座 Qwen-1.8B | 25.84(单语口径)/ 28.99(混合口径) |
| 重写为 QA(分离训练 ParaData-Sep) | 38.16 |
| 直接用 QA(分离训练 QAData-Sep) | 38.53 |
| ParaData-Mix(平滑过渡) | 35.40 |
| QAData-Mix(Apollo 配方) | 38.53(混合口径 44.74 见主表) |
结论:改写为 QA 相对直接续训"整体无损",部分语言(英/印地)略有波动但其他语言提升,配合 Mix Training 平滑过渡后在主表拿到 44.74 的平均分(较基座 28.99 提升 15.75 分)。HF 上每个预训练分片都带 _qa 副本文件,就是这条流水线的固化产物。
4.3 Mix Training 与 Priority Sampling:两个阶段的平滑焊接
训练数据 D = D_PT(继续预训练)∪ D_SFT(指令微调)。朴素做法是先吃 D_PT 再吃 D_SFT,阶段切换处分布突变。ApolloCorpus 的配套训练法是 priority sampling:每条数据 x 在第 t 步的采样概率按 π(x) 加权归一(P_t(x) = π(x) / Σ π(y),已采过的集合 S_t 被扣除),论文设定 π=16(预训练数据)、π=2(指令数据),即预训练数据的采样权重是指令数据的 8 倍,同时保持"先预训练后指令"的全局序列——切换被摊平成缓坡而非断崖。训练超参:batch size 256、学习率 1e-5。
这一节的意义在于:ApolloCorpus 发布的不只是数据,还有数据的使用方式——论文把采样配比、阶段顺序、超参全部写明,配方可复制性在同类语料发布中属于高水准。
4.4 数据泄漏检查与质量控制
论文 §3.1 设有专节 “Data Leakage Checking”(确保评测集不混入训练语料);附录 A.1 专门交代分类学与采集细节、A.2 交代改写细节。需要指出:与库内影像类数据集常见的"逐例标注协议"不同,本语料的质量控制重心在来源筛选(词典过滤、长度过滤、考试题库)与改写一致性(ChatGPT prompt 模板统一),没有人工逐条抽检的量化报告——审计深度弱于标注型数据集,使用者应把 Web 分片视为"需二次清洗"的原料(§8)。
§5 获取与许可:三条路,零门槛
5.1 License
数据集 license 为 Apache-2.0——HF API cardData.license 与 tags 双重确认(一手),这也是 22.3 GB 级医疗预训练语料里相当宽松的许可:允许商用、允许修改再分发、要求保留许可声明与 NOTICE。对比参照:Meditron 依赖的语料许可各异、PMC 系语料常受 PubMed 版权约束、部分中文医疗数据集限研究用途——ApolloCorpus 的 Apache-2.0 使其成为六语言医疗预训练里"许可最省心"的一档。
边界说明:Apache-2.0 覆盖的是发布物(JSON 文件的组织与再分发),不等于其中每一条底层文本的原生版权(书籍/论文/考试题在其原地的版权状态各有归属)——学术与商用前对具体分片的合规审查仍不可豁免,尤其 Books/Papers 分片(§8 坑 5)。
5.2 三条获取路径
- HF datasets 直载(推荐给训练管线):
load_dataset("FreedomIntelligence/ApolloCorpus", "pretrain_text")获得 13 个预训练 text splits;SFT 散文件经data_files参数手动挂载。 - 整包 zip:仓库根目录
ApolloCorpus.zip(约 22.3 GB),内含论文复现所需的完整目录结构(pretrain + sft)。 - GitHub 脚本:FreedomIntelligence/Apollo 仓库的
0.download_data.sh——论文复现流水线的第一步,自动拉取数据并按模型整理。
工程提示:HF 主站在部分网络环境不可直连,可走镜像站(把 huggingface.co 换成 hf-mirror.com,API 与 resolve 路径同构);整包 zip 适合一次性归档,散文件适合按语言/类型增量取用(例如只要六语言 SFT 时不必拉 22.3 GB)。
5.3 配套发布的另外两件套
- XMedBench(HF FreedomIntelligence/XMedbench):六语言医疗多选基准(§6 详述),与语料同 license 体系发布。
- Apollo 模型权重:0.5B/1.8B/2B/6B/7B(论文五款)+ 34B/72B(GitHub 列出)+ MedJamba + 四款 GGUF 量化版(0.5B/2B/6B/7B,mradermacher 协助)。
5.4 版本状态
HF 数据集 repo 自 2024-09-13 后未再修改(lastModified 一手),无 v2/修订版;arXiv 论文最新 v6(2024-10-12)。换言之,这是一个已冻结的发布:内容不会漂移,引用时注明抓取时点即可复现。发布日期口径注意:GitHub README 写 “2024.02.12 published”,而 HF repo createdAt 为 2024-03-06(坑 7)。
§6 XMedBench 与 Apollo 模型:语料的成绩单
6.1 XMedBench:六语言医疗多选基准
XMedBench 是与语料配套发布的评测集,设计逻辑是"每语言至少一个本源基准,缺就翻译补齐":
| 语言 | 组件 | 说明 |
|---|---|---|
| EN | MedQA-USMLE、MedMCQA、MMLU-Medical(Clinical knowledge / Medical genetics / Anatomy / Professional medicine / College biology / College medicine) | 全部本源;PubMedQA 因结果波动过大被排除出论文 |
| ZH | MedQA-MCMLE、CMMLU-Medical(Anatomy / Clinical_knowledge / College_medicine / Genetics / Nutrition / Traditional_chinese_medicine / Virology) | CMB-single(随机 2,000 单选)与 CExam(随机 2,000)未入论文 |
| ES | HeadQA | 西班牙语本源医学考试基准 |
| FR | FrenchMedMCQA | 法语本源 |
| HI | MMLU_HI(Clinical knowledge 等六个医学子集) | 印地语无本源基准——MMLU 医学子集翻译版,经专业医师校验 |
| AR | MMLU_Ara(同上六子集) | 阿拉伯语同法处理 |
评估协议:3-shot、正则抽取选项、生成长度上限 128/下限 2 tokens、0.5B 全精度加载其余半精度。
一个检索级警告:GitHub README 的 XMedBench 清单里,HI 行的链接实际指向 MMLU_Arabic、AR 行的链接实际指向 MMLU_Hindi——两行链接互换(坑 4)。以论文正文与本表为准。
6.2 基座-Apollo 配对表:领域语料值多少分
论文 Tab.3(“Our Models and their Bases” 区块)把每个 Apollo 与其基座并排放置——这张表实质上是"吃下 ApolloCorpus 能涨多少分"的量化答案:
| 基座 | 基座 avg | Apollo | Apollo avg | 增幅 |
|---|---|---|---|---|
| Qwen-0.5B | 19.17 | Apollo-0.5B | 37.47 | +18.30 |
| Qwen-1.8B | 28.99 | Apollo-1.8B | 44.74 | +15.75 |
| Gemma-2B | 28.74 | Apollo-2B | 39.94 | +11.20 |
| Yi-6B | 46.65 | Apollo-6B | 57.54 | +10.89 |
| Gemma-7B | 52.44 | Apollo-7B | 58.78 | +6.34 |
两个可直接迁移的结论:其一,基座越弱、语料增益越大(0.5B 档涨 18.3 分 vs 7B 档涨 6.3 分)——领域语料对小模型的边际价值远大于大模型;其二,基座横跨 Qwen×2、Gemma×2、Yi×1,说明配方对基座家族不敏感。第三方转述常把 Apollo 说成"基于 Qwen 架构"——那只对 0.5B/1.8B 成立,7B 的基座是 Gemma-7B(坑 7)。
6.3 同场对比:Apollo-7B 在 2024 年的位置
XMedBench 上 Apollo-7B(58.78)与同期代表模型:
| 梯队 | 模型 | avg |
|---|---|---|
| 闭源 | GPT-4 | 73.37 |
| 闭源 | GPT-3.5 | 57.80 |
| 开源 >70B | Qwen-72B | 68.74 |
| 开源 >70B | Meditron-70B | 47.60 |
| 开源 >70B | Llama-2-70B | 36.63 |
| 开源 7-14B | Qwen-14B | 52.67 |
| 开源 7B 级 | Gemma-7B | 52.44 |
| 开源 7B 级 | MMedLM2-7B | 51.45 |
| 开源 7B 级 | Mistral-7B | 43.16 |
| 开源 7B 级 | Qwen-7B | 40.01 |
| 开源 7B 级 | BioMistral-7B | 38.08 |
| 开源 7B 级 | Huatuo2-7B | 36.72 |
| 本条目 | Apollo-7B | 58.78 |
Apollo-7B 以 7B 体量压过全部 ≤70B 开源对手并小幅超过 GPT-3.5(58.78 vs 57.80)——这是论文"lite 模型民主化"叙事的实证支点。附带发现(论文 §4.3):多语言混合训练优于单语言训练(pilot study 中混合训练六语言平均全面高于任一单语模型),医疗知识被论证为"相当程度上语言中立",跨语言训练产生协同增益——这为低资源语言"搭便车"高资源语言提供了数据层面的论据。
6.4 Proxy-Tuning:小模型语料的第三种用法
论文 §5 展示了 lite Apollo 的另一用途:proxy-tuning——不改动大模型权重,用"微调前后的小模型对"(M_tuned − M_raw)的 logit 偏移量在推理时修正大模型 M_base:output = M_base + (M_tuned − M_raw)。即用 Apollo-1.8B(及其 Qwen-1.8B 原基座)的差值作为"医疗化算子"叠加到更大模型上。第三方转述口径:对 Qwen-7B 平均提升约 3 分。对数据使用者的含义是:这份语料训练出的任意规模模型,都可以作为"领域修正器"资产化,而不只充当独立部署的端到端模型。
§7 生态:上下游与库内互链
7.1 数据流上游(被并入本语料的公开资产)
PMC-Patients(EN 对话改写源)、HuatuoGPT 与 Huatuo_26M(ZH 对话源)、MAQA(AR 对话源)、CMB(ZH 考试源)、ShareGPT / Alpaca / WizardLM / belebele / ai2_arc / Capybara(通用指令源)。这份上游清单本身就是一份"2024 年初多语言医疗/通用指令数据"的选型地图:想在别的语种复刻 Apollo 配方,逐项替换对应语言的等价物即可起步。
7.2 数据流下游(消费本语料的作品)
Apollo 0.5B/1.8B/2B/6B/7B/34B/72B 模型系、MedJamba(2024-04)、ApolloMoE(2024-10,宣称 50 语言)、四款 GGUF 量化部署版,以及 proxy-tuning 范式下的各类"借力"应用。论文引文网络显示后续工作包括 BioMistral(多语言评测视角)、BiMediX(双语)、MMedLM/MMedLM2、Medical mT5、Aqulia-Med 等——ApolloCorpus 与 XMedBench 成为多语言医疗 LLM 论文的标准对照物之一。
7.3 库内互链点(rid 已核,2026-09-28)
| 库内条目 | rid | 互链逻辑 |
|---|---|---|
| medmcqa | 111 | XMedBench-EN 评测组件之一(印度医学考试题),同属"考试题驱动医疗 LLM"路线 |
| headqa | 120 | XMedBench-ES 评测组件(西班牙语医学考试),ApolloCorpus Exams-ES 的同域参照 |
| cmb-cmexam | 180 | XMedBench-ZH 评测同源(CMB 训练集直接并入本语料 Exams-ZH;cmexam 亦被列入未用组件) |
| pmc-oa | 320 | PMC 文献语料——medicalPaper-EN(252.9M token)的同域大规模对照 |
| s2orc | 370 | 生物医学文献大规模语料——论文侧来源的量级参照系 |
| meddialog | 210 | 医患对话语料——Dialogues 分片(EN/ZH/AR 共 149.1M token)的同类对照 |
另建议反向互链:panda-plus(640) 等金标准条目如涉及"AI-Ready 光谱"讨论,可将 ApolloCorpus 作为"文本语料类 Apache-2.0 全开放"端点引用。
§8 使用注意事项:八个坑,逐个排雷
以下八条是检索、引用与使用本语料时最容易踩的坑,编号连续,均为一手核验所得(核验时点 2026-09-28)。每条给出"现象—影响—建议"三段式。
坑 1:单复数双写法——ApolloCorpus 还是 ApolloCorpora?
现象:HF 数据集名叫 ApolloCorpus(单数),论文摘要与正文叫 ApolloCorpora(复数),GitHub README 两种写法混用。论文自身也不统一:摘要写 “the ApolloCorpora multilingual medical dataset”,致谢部分写 “training corpora”。
影响:文献检索时用单数会漏掉论文正文语境下的讨论,用复数会漏掉 HF 与模型卡语境下的讨论;引用复核时容易误判为两个东西。
建议:把它们当作同一语料的两个拼写变体。条目/论文引用用论文口径 ApolloCorpora,数据工程语境用 HF 口径 ApolloCorpus;首现处标注双写法即可,不必强行统一。
坑 2:宣传六语言,预训练实物只有五语言
现象:论文摘要、标题、HF 数据卡全部主打 “six languages / 六语言”;但 HF 发布的预训练文件矩阵(medicalBook/medicalGuideline/medicalPaper/medicalWeb/medicalWiki × 语言)里只有 en/zh/es/fr/hi 五种语言——没有任何 ar 预训练分片。阿拉伯语只在 SFT 出现:general_ar.json 与 medicalPatient_ar.json。论文 Tab.2 声称 Dialogues 含 AR 10.4M 继续预训练 token,但 HF 上找不到对应文件。
影响:按"六语言预训练语料"的预期做六语言继续预训练,阿语侧会拿到比预期少得多的数据(仅 18.7M general + medicalPatient 指令数据,无原始文本分片);与"覆盖 61 亿人口"的宣传存在心理落差。
建议:以 HF 发布实物为准规划数据配比;若必须阿语预训练文本,需自行引入 MAQA 原始数据或其他阿语医疗语料补充,并在论文引用时如实区分"论文叙述构成"与"HF 发布构成"。
坑 3:三个"大小"数字各有所指
现象:22.3 GB(HF 页面 Total file size)、39,147,380,685 B ≈ 36.5 GiB(HF API usedStorage)、3,741,196 rows(HF viewer)三个数字常被混用。行数口径只覆盖 pretrain_text config 的 13 个 _text splits——不含 _qa 副本、不含全部 SFT 散文件;usedStorage 则把 zip 整包与全部 LFS 历史都算进去。
影响:把 3,741,196 当"全部数据条数"会低估;把 36.5 GiB 当"下载体积"会高估磁盘需求。
建议:引用行数注明"pretrain_text 13 splits 口径";引用体积用 22.3 GB 并注明"页面口径";需要精确磁盘预算时以 zip 整包实测为准。
坑 4:GitHub README 的 HI/AR 基准链接互换
现象:GitHub README 的 XMedBench 清单里,HI(印地语)条目的链接实际指向 MMLU_Arabic 数据集,AR(阿拉伯语)条目的链接实际指向 MMLU_Hindi 数据集——两行链接互相错位。
影响:顺着 README 链接下载评测数据,印地语评测会拿到阿拉伯语题集,反之亦然;跑分后与论文完全对不上。
建议:以论文正文语言-基准对应关系为准(HI→MMLU_HI、AR→MMLU_Ara);下载后用样本语言肉眼抽检一遍。
坑 5:Apache-2.0 是发布许可,不是底层文本的版权豁免
现象:数据集以 Apache-2.0 发布(HF API 一手确认),但其中 Books(413.8M token)、Papers(349.0M token)、Guidelines(29.6M token)分片的底层文本来自受版权保护的出版物、论文与指南;Exams 分片来自考试题库(CMB 等,其原生许可各异);Web 分片来自在线论坛。
影响:把"Apache-2.0"理解为"其中所有内容可无顾忌商用"是过度引申;不同司法辖区对 TDM(文本与数据挖掘)例外条款的宽严差异很大。
建议:学术与内部评测用途风险最低;对外分发衍生产品(尤其是复述书籍内容的模型)前,按分片逐类评估底层版权与属地 TDM 例外;商用产品优先依赖 SFT/general 类由模型生成的分片。
坑 6:作者名与署名数的三个口径
现象:① 名字拼写:arXiv abs 页 “Junyin Chen” vs 论文 HTML 正文 “Junying Chen”(团队其他项目惯用后者);② 署名数:abs 页 12 人 vs README 建议 BibTeX 10 人(少了 Guorui Zhen 与 Chunxian Zhang);③ 标题冠词:abs 页 “A Lightweight”(v6 定稿)vs v4 HTML “An Lightweight” vs BibTeX “Lightweight”(无冠词)。
影响:引用条目与论文页不一致,审稿/复核时容易被判为引用错误。
建议:以 arXiv abs v6 页面为引用权威(12 作者、“Junyin Chen” 按其页——如需与团队其他工作一致性优先则注 Junying 并加注);标题用 “A Lightweight”;引用条目如用 README BibTeX,知悉其比 abs 页少两人。
坑 7:基座传闻——"Qwen backbone"只对了一半
现象:多个第三方转述(含英文技术博客)把 Apollo 系列概括为 “using the Qwen architecture as a backbone”。论文 Tab.3 一手表格显示五个基座:Qwen-0.5B、Qwen-1.8B、Gemma-2B、Yi-6B、Gemma-7B——七个规模里只有两个是 Qwen。
影响:按"Qwen 系微调"预期选择推理栈/tokenizer 会在 2B/6B/7B 三个规模上出错(Gemma 与 Yi 的 tokenizer、特殊 token、许可条款都不同);引用"Qwen 架构"会让领域综述失真。
建议:一切以论文 Tab.3 配对表为准;部署时逐规模核对 HF 模型卡的架构与 tokenizer 说明(GGUF 页标注的 llama 架构是 llama.cpp 的类别标签,不等于原基座)。
坑 8:34B/72B 的对话模板与 0.5B-7B 不同
现象:GitHub README 明确两套 usage format:0.5B/1.8B/2B/6B/7B 用 User:{query}\nAssistant:{response}<|endoftext|>;34B/72B 用 <|User|>:{query}\n<|Assistant|>:{response}<|endoftext|>。
影响:把 7B 的模板套到 34B/72B(或反之),推理质量会显著劣化;自动化评测脚本若写死一种模板会静默出错。
建议:按规模档分别配置模板;评测复现时先用模型卡的 few-shot 样例验证模板生效(论文评估协议为 3-shot)。
使用注意事项小结表
| 坑 | 一句话版本 | 优先级 |
|---|---|---|
| 1 | ApolloCorpus/ApolloCorpora 是同一语料 | 引用时 |
| 2 | 预训练无阿拉伯语,ar 仅 SFT | 建模前 |
| 3 | 行数/页面体积/API 占用三口径 | 引用时 |
| 4 | README 的 HI/AR 评测链接互换 | 评测前 |
| 5 | Apache-2.0 ≠ 底层文本版权豁免 | 商用前 |
| 6 | 作者拼写/署名数/标题冠词三口径 | 引用时 |
| 7 | 基座是 Qwen+Gemma+Yi 混合,非全 Qwen | 部署前 |
| 8 | 34B/72B 对话模板另有一套 | 部署前 |
§9 方法论读评:这份语料做对了什么、没做什么
9.1 做对的四件事
- token 账本公开到 0.1M:论文 Tab.2 把每类每语言的 token 配比写透,配合训练超参与采样公式(π=16/2),配方可复制性在同类发布里属第一梯队。多数多语言医疗语料只给总量不给配比,导致后续工作无法做受控对照。
- 在数据侧解决预训练-对齐冲突:QA-Augmented Pre-training 把"改写"固化为发布物的一部分(
_qa文件与_text并行),后人不必重跑改写流水线即可复用两种视图——这是"数据集即方法"的设计,也是本条目把它列为 AI-Ready 关键特征的原因。 - 基座多样性验证:五个规模横跨三个基座家族,等于附带做了一组"配方跨基座稳健性"实验,结论(基座越弱增益越大)可直接迁移。
- 许可一步到位:Apache-2.0 + 无 gated + zip/散文件/API 三通道,取用摩擦接近于零——在医疗语料里是稀缺体验。
9.2 没做的三件事(使用者的对价)
- 无逐类质量审计报告:没有人工抽检准确率、没有 Web 分片毒性/错误信息比例、没有去重前后统计(仅从文件名可推断 medicalExam 有 dedup 流程)。使用者拿到的是"清洗过但未审计"的语料。
- 低资源语言止步于"有":HI 预训练百科 209 行、AR 预训练缺失——"民主化"叙事在数据实物层面兑现度有限,更像一次诚实的现状披露(印地语医学百科就这么多)。
- 生成式改写未标注单据:
_qa文件与 general 分片由 ChatGPT/GPT-4 生成或改写,但 HF 卡与论文均未提供逐条"生成来源"标记,无法把"自然采集文本"与"模型生成文本"在行级区分——做数据配比研究时需要自行推断。
9.3 一句话定位
ApolloCorpus 是"方法论文驱动的语料发布":它最大的价值不在数据量(2.5B tokens 在 2024 年属中型),而在它公开了一整套"多语言医疗 LLM 应该怎么喂"的可复制配方,并用 Apollo 模型系与 XMedBench 为配方提供了端到端验证。把它当作配方样本+许可友好的六语言医疗原料库,比当作"最大医疗语料"来用,更能发挥其价值。
§10 二次利用指南:四种打开方式
10.1 用法一:继续预训练(语料的设计主用途)
按论文配方,继续预训练的推荐姿势:
- 数据配比:以预训练侧约 2.0B token 为基(Web 886.7 + Books 413.8 + Papers 349.0 + Encyclopedias 226.2 + Dialogues 149.1 + Guidelines 29.6),叠加指令侧约 0.5B token(General 364.9 + Exams 78.0 + Math 22.6 + Code 16.4),比例约 4:1。
- text 与 qa 并用:每个分片取
_text与_qa双视图;如按论文消融,QA 视图对最终成绩无损且保指令能力,可将 qa 权重适当调高。 - 采样策略:若自训框架支持动态采样,按 priority sampling(π_PT=16、π_SFT=2)平滑过渡;若只支持静态混合,直接按 token 比例混合亦可近似。
- 基座选择:多语言能力优先选 Qwen 系(论文 pilot study 选 Qwen-1.8B 正因其多语言支持);若目标是欧洲语言对(ES/FR),Gemma 系亦有一手验证(Apollo-2B/7B)。
- 超参起点:batch size 256、lr 1e-5(论文设定,7B 级以下验证有效)。
10.2 用法二:SFT/领域指令微调
只取 train/sft/ 目录即可开展:五类指令数据(code/general/math/medicalExam/medicalPatient)× 六语言。实用建议:
- 医疗考试向:medicalExam(en/es/fr/zh)+ 医学问答对——与库内 medmcqa(111)、headqa(120)、cmb-cmexam(180) 等原生考试数据集组合时,注意 CMB 训练集已被并入本语料,联合训练需去重(坑 9 补注:变体文件
_dup/_clean即团队去重流程的痕迹)。 - 医患对话向:medicalPatient(ar/en/zh)+ meddialog(210) 同类组合,注意 EN 对话系 ChatGPT 从 PMC-Patients 改写生成,风格偏"教科书式问诊"。
- 通用能力保底:general 分片在六语言间最均衡(18.7M-194.5M token),是多语言指令对齐的现成材料。
10.3 用法三:RAG 语料库
_text 分片(尤其 Books/Encyclopedias/Guidelines/Papers 四类)适合切块入库做检索增强:内容相对结构化、长度分布已知(medicalWeb_zh 实测 32-34.7k 字符/条)。注意事项:Web 分片论坛体噪声大,建议 RAG 库排除或降权;Guidelines 仅英文(29.6M token),非英文指南检索需另寻数据源。
10.4 用法四:评测与对照实验
- 直接用 XMedBench(六语言)评测自研模型,与论文 Tab.3 的 20+ 模型分数对标;
- 用语料做"领域增益"对照实验:同基座 ± ApolloCorpus 续训,直接引用 Tab.3 增幅区间(+6.3 到 +18.3 分)作预期管理;
- 低资源语言研究:HI/AR 侧的数据稀缺实物本身即是研究素材(低资源医疗 NLP 的数据可得性案例)。
10.5 语言覆盖实操速查
| 需求语言 | 预训练可得 | SFT 可得 | 质量预期 |
|---|---|---|---|
| 英语 EN | 五类齐全(约 1,546M token,含 qa 副本) | 五类齐全 | 最高;论文/书籍/指南原生内容为主 |
| 中文 ZH | 四类(无 guideline 分片,约 621M) | 五类齐全 | 高;对话/考试借力 HuatuoGPT/CMB 资产 |
| 西班牙语 ES | 两类(paper/web,约 122M) | 三类(general/math 无,exams/patient 有) | 中;考试与对话可用 |
| 法语 FR | 两类(paper/wiki,约 29M) | 三类 | 中低;FrenchMedMCQA 评测可补偿 |
| 印地语 HI | 一类(wiki 209 行 / 0.5M token) | 一类(general 43.9M) | 低;评测有翻译版 MMLU_HI |
| 阿拉伯语 AR | 无预训练分片 | 两类(general 18.7M + patient) | 低;预训练需自补 MAQA 等 |
§11 同期多语言/医疗语料对比:ApolloCorpus 在版图上的位置
11.1 横向对照(论文引文网络 + 公开口径)
| 语料/数据面 | 主导语言 | 医疗覆盖 | 发布体量 | 许可 | 与 ApolloCorpus 的差异点 |
|---|---|---|---|---|---|
| ApolloCorpus(本条目) | 6 语言 | 预训练+SFT 全栈 | 2.5B tokens / 22.3 GB | Apache-2.0 | 唯一把"预训练+SFT+基准+模型"四件套配齐的多语言医疗发布 |
| MEDITRON-70B 语料面 | EN | 指南+论文 | 约 475M token 级(指南精选+PubMed 集合) | 多源各异 | 单语深挖指南;Apollo 走广度,Meditron 走英文深度 |
| PMC-LLaMA 语料面 | EN | 论文+书籍 | 约 4.8M 论文+30k 书籍口径 | 多源各异 | 学术文献中心主义;无对话/考试/网络分片 |
| BioMistral 语料面 | EN(评测多语) | 论文(PubMed Central) | 期刊语料+多语言评测 | CC 系 | 首提多语言评测视角,但训练语料仍英文中心 |
| MMedLM2 语料面 | EN/ZH 为主 | 论文+教材+网络 | 约 32B token 口径 | 逐源声明 | 体量大两个量级但语言少于 6;评测用 MMedBench |
| HuatuoGPT-II 语料面 | ZH/EN | 论文+书+对话 | 未全量开源 | 部分 | Apollo 的 ZH 对话上游;闭源成分高 |
| 通用多语言(mC4 等) | 100+ 语言 | 医疗混于全网 | TB 级 | OSL 系 | 无医疗策展;Apollo 相当于"医疗策展版切片" |
11.2 差异化定位三句话
- 对多语言医疗这一格:2024 年时点上,ApolloCorpus 是第一个把六种语言的医疗预训练+SFT 成规模打包并 Apache-2.0 发布的语料——它填补的是"非英语医疗预训练数据无正式发布渠道"的空档。
- 对英语/中文医疗语料:它不是最大也不是最深(MEDITRON 的指南深度、PMC-LLaMA 的论文广度都超过它对应分片),它的英文/中文价值在于"与五语言共训练"的配比方案本身。
- 对数据集工程教学:Tab.2 的 token 账本 + 消融实验(QA 改写/混合训练)+ 基座配对表,构成一份少见的"数据-训练-评测"三方对账样本,适合作为数据工程课程的 dissect 标本。
11.3 引用格式(README 建议原文)
@misc{wang2024apollo,
title={Apollo: Lightweight Multilingual Medical LLMs towards Democratizing Medical AI to 6B People},
author={Xidong Wang and Nuo Chen and Junyin Chen and Yan Hu and Yidong Wang and Xiangbo Wu and Anningzhe Gao and Xiang Wan and Haizhou Li and Benyou Wang},
year={2024},
eprint={2403.03640},
archivePrefix={arXiv},
primaryClass={cs.CL}
}
(注意:此 BibTeX 列 10 作者,较 arXiv abs 页 12 作者少 Guorui Zhen、Chunxian Zhang——坑 6。)
§12 进阶 FAQ:六个深入问题
Q1:为什么说这是"方法论文驱动的发布",与"数据集论文驱动的发布"有何不同?
传统数据集论文(如库内大量标注型条目)以"数据本身的新颖性"立论——新采集、新标注、新类别体系。Apollo 论文以方法立论(QA-Augmented Pre-training、Mix Training、Proxy-Tuning),语料是方法的输入与证物:论文的全部数字(Tab.1-5)围绕"怎么喂"而非"数据长什么样"。这决定了它的 FACTS 密度分布:token 账本、采样公式、消融分数一应俱全,而逐条文本的质量抽检、来源许可逐条清单阙如。使用时的预期应据此校准。
Q2:3,741,196 行里,一条"行"到底多大?
viewer 实测 medicalWeb_zh 的 text 字段长度分布为 32 至 34,700 字符,其他分片未逐条公布分布。粗略对账:2.5B tokens ÷ 3.74M 行 ≈ 每行 677 token(仅按 pretrain text 口径,混合多语言与多类目),即多数行是"段落-短文"粒度而非整章整篇——切块入库时按行即块是合理起点,Web 分片建议再按句切。
Q3:_qa 文件与 _text 文件可以混着训练吗?
可以且被论文验证:消融显示 QA 视图相对原始续训"整体无损",Mix 配方下 QA 视图还略优(QAData-Mix 38.53 vs ParaData-Mix 35.40,Tab.4 口径)。工程上建议两种视图都进池子,由采样策略控制占比;但要意识到 _qa 是 ChatGPT 改写物——它承载的是"改写者模型"的医疗知识水平(2023-2024 年的 GPT-3.5/4),不是原文本作者的。
Q4:medicalExam 的 _dup/_clean/_dup_question 变体文件是什么?
文件名与数量(en/es/fr/zh 各三份变体)表明团队对考试题分片跑过去重流程:_dup 应为未去重/含重复的原始抽取,_clean 为清洗版,_dup_question 为按题干判重的中间产物(推断性命名解读,论文未逐文件说明——待核 T4)。实用建议:直接用 _clean 版,其余作审计留档。
Q5:为什么 Apollo 论文要顺便发 XMedBench,而不是只用现成基准?
因为印地语与阿拉伯语当时没有本源医学多选基准——"六语言评测"无从谈起。论文的做法是翻译 MMLU 医学子集(六子集:Clinical knowledge、Medical genetics、Anatomy、Professional medicine、College biology、College medicine)并请专业医师校验,凑齐 HI/AR 两侧;ES/FR/ZH/EN 则直接用本源基准(HeadQA、FrenchMedMCQA、MedQA-MCMLE/CMMLU、MedQA-USMLE/MedMCQA)。这也是为什么 XMedBench 的 HI/AR 组件实为 MMLU 翻译版——解读阿语/印地语分数时要记得它们的"原生性"弱于 ES/FR 侧。
Q6:Apollo-34B/72B 是从哪来的?论文里没提。
论文正式规模只有 0.5B/1.8B/2B/6B/7B(Tab.3 配对表);34B/72B 出现在 GitHub README 的模型清单与对比分组(使用 Qwen 风格特殊 token 模板,推断为 Qwen 系基座的后续扩展,论文未附训练与评测细节)。引用"Apollo 系列"性能结论时应限定在论文五款;34B/72B 只能作存在性引用。
§13 伦理与治理视角:一份"民主化"叙事的诚实对账
13.1 叙事与实物的落差
论文标题的 “6B People” 与图 1 的"语言-预期寿命"可视化,把 ApolloCorpus 定位为低资源地区的医疗基础设施。实物对账:英语占 token 约 61%,印地语约 1.7%,阿拉伯语约 1.1%;HI 预训练文本仅 209 行,AR 预训练分片缺席。这不是作者失信——他们在 Tab.2 里把稀缺如实写了出来——但引用"六语言覆盖 61 亿人"时应同时引用 token 配比,避免读者形成均衡覆盖的错觉。
13.2 生成式改写的知识治理
语料中两类内容是"模型写的":预训练 _qa 副本(ChatGPT 改写)与 SFT general 分片(GPT-4 生成/WizardLM 法)。其医疗陈述的可靠性受制于生成时点的基础模型水平,且未经逐条医学审核的公开记录。用于医疗问答产品前,建议:① 以 medicalExam(人类出题)与 Dialogues 源头数据(MAQA 是真实问答、HuatuoGPT 对话源自真实语料改写)为高信任层;② _qa 与 general 分片标记为"生成文本层"并按用例分级使用。
13.3 论坛文本与患者隐私
medicalWeb 分片源自在线医疗论坛(论文注明),虽属公开发言,但患者叙事中自曝的可识别信息(用药、病程、地区)难以从技术面完全排除;发布方未公开 PII 处理流程的独立审计。RAG/对话产品接入该分片前建议跑一遍 PII 扫描与过滤。
13.4 许可治理的三层观
第一层是发布许可(Apache-2.0,明确且宽松);第二层是底层文本版权(书籍/论文/试题的原生权利不因再发布而消灭,坑 5);第三层是生成内容的责任链(改写 prompt 由发布方设计,生成内容的风险归属在商用司法实践中仍在演化)。三层各自独立,逐层核查是稳妥姿势。
13.5 冻结发布的利与弊
语料自 2024-09 起未更新,这带来双面性:利——引用可复现、内容不漂移、下游实验可比;弊——2024 年后的医学知识(新指南、新药、新共识)自然缺席,直接用于临床知识密集任务时会带着"2024 年中之前的世界观"。生产系统应将其视为基座知识源之一,配时效性内容更新机制。
附录 A:数据档案速查卡
| 维度 | 内容 |
|---|---|
| 类型 | 多语言医疗 LLM 训练语料(继续预训练 + SFT 双阶段,文本型) |
| 论文 | arXiv:2403.03640(v1 2024-03-06 / v6 2024-10-12,Preprint) |
| 团队 | FreedomIntelligence(港中深 + 深圳大数据研究院),通讯 Benyou Wang |
| 规模 | 3,741,196 行(pretrain_text 13 splits 口径)/ 22.3 GB(页面口径)/ 2.5B tokens(论文口径) |
| 语言 | en/zh/es/fr/hi/ar(六语言宣传口径);HF 预训练实物五语言,ar 仅 SFT |
| 结构 | pretrain:{source}{lang}{text\ |
| 方法 | QA-Augmented Pre-training + Mix Training(priority sampling π=16/2)+ Proxy-Tuning |
| 衍生模型 | Apollo 0.5B/1.8B/2B/6B/7B(基座 Qwen/Gemma/Yi 混合)+ 34B/72B + MedJamba + ApolloMoE |
| 基准 | XMedBench(六语言);Apollo-7B avg 58.78(GPT-3.5 57.80;≤70B 开源居首) |
| 许可 | Apache-2.0(HF API 一手确认,无 gated) |
| 抓取时点 | 2026-09-28 |
| 库内互链 | medmcqa(111)/headqa(120)/cmb-cmexam(180)/pmc-oa(320)/s2orc(370)/meddialog(210) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | HF dataset card + arXiv 论文 + GitHub 三入口互链,名称唯一性高;唯 ApolloCorpus/ApolloCorpora 双写法与 Apollo 模型系同名干扰(坑 1)微降分 |
| A 可获取性 | 9 | Apache-2.0、无 gated、直链/整包/脚本三通道、22.3 GB 一次性可得;扣分项:低带宽环境下载成本、HF 主站可达性区域差异 |
| I 可互操作 | 8 | JSON 标准格式、HF datasets config 化(pretrain_text 13 splits)、文件命名自解释;SFT 无统一 config 需手动挂载、_qa 副本不在默认 config 内微降分 |
| M 元数据质量 | 7 | 论文 Tab.2 token 账本精确到 0.1M、训练配方完整公开;但 HF 卡语言列表有笔误、行数-体积多口径并存、变体文件无文档(待核 T4) |
| S 可持续性 | 6 | 依托 HF/GitHub 平台稳定、发布已冻结可复现;但 2024-09 后无维护、无修订版机制、上游(如 MAQA)可得性不受本项目控制 |
| 综合评级 | 7.6/10(良) | 可获取性与配方透明度是长板;元数据小笔误与冻结式维护是短板。在"文本语料类"库内条目中属可获取性第一梯队 |
附录 C:逐项证据链自证
| 关键数字/事实 | 来源 | 位置/方式 |
|---|---|---|
| 3,741,196 rows / 22.3 GB / downloads | HF 页面快照 | huggingface.co/datasets/FreedomIntelligence/ApolloCorpus(搜索快照直读) |
| license apache-2.0 / usedStorage 39,147,380,685 B / createdAt / lastModified / 13 splits / siblings 文件清单 | HF API | hf-mirror.com/api/datasets/FreedomIntelligence/ApolloCorpus(一手 JSON,2026-09-28) |
| 2.5B tokens / Tab.2 token 账本 / π=16,2 / batch 256 / lr 1e-5 / 36,107 词条 | 论文 HTML v6 | arxiv.org/html/2403.03640v6(curl 全文抓取 + 表格解析,一手) |
| 基座配对(Qwen×2/Gemma×2/Yi×1)/ Apollo-7B 58.78 / GPT-4 73.37 / GPT-3.5 57.80 | 论文 Tab.3 | 同上(HTML 表格逐行解析,一手) |
| 六语言覆盖 6.1B 人口 / 132 国家地区 | 论文 §1 脚注 | 同上(一手) |
| PMC-Patients/HuatuoGPT/Huatuo_26M/MAQA/CMB/ShareGPT/Alpaca/WizardLM/belebele/ai2_arc/Capybara 溯源 | 论文 §3.1 | 同上(一手) |
| 时间线五事件 / usage format 双模板 / GGUF 致谢 | GitHub README | github.com/FreedomIntelligence/Apollo 页面(一手渲染页) |
| arXiv v1-v6 日期链 / 12 作者 / DOI | arXiv abs 页 | arxiv.org/abs/2403.03640(一手) |
| viewer 行数分布(medicalWeb_zh 32-34.7k 字符等) | HF viewer 快照 | huggingface.co/datasets/.../viewer/pretrain_text/medicalWeb_zh?p=312(搜索快照) |
| “Qwen architecture as a backbone”(二手转述,已被一手表格修正) | Lacuna/BearPlex | 第三方分析页(仅用于坑 7 存照) |
| Scholar 被引 71 / arxiv.gg Cited by 19 | 搜索快照 | 2026-09-28(仅背景,不作为硬数字) |
| DB 查重 0 命中 | 库内只读查询 | SELECT ... WHERE url_name ILIKE '%apollo%' → (0 rows) |
附录 D:获取决策树
你的需求是什么?
├── 做多语言医疗 LLM 继续预训练
│ ├── 1) 按语言需求核对附录 J 语言表(注意 ar 无预训练分片——坑 2)
│ ├── 2) load_dataset("FreedomIntelligence/ApolloCorpus", "pretrain_text") 取 13 splits
│ ├── 3) 另取 train/pretrain/*_qa.json 双视图 + train/sft/ 指令数据
│ └── 4) 按 §4.3 配方(π=16/2 混合采样)训练
├── 只做医疗 SFT
│ ├── 需要阿拉伯语/印地语 → general_* 文件(唯一均衡项)
│ ├── 需要医患对话 → medicalPatient_{ar,en,zh}.json
│ └── 需要考试题 → medicalExam_*_clean.json(用 clean 版,见 §12-Q4)
├── 搭 RAG 语料库
│ ├── 首选 medicalBook/medicalWiki/medicalGuideline/medicalPaper 的 _text 分片
│ ├── 排除或降权 medicalWeb(论坛噪声,§13.3)
│ └── 按行切块(行均约 677 token),Web 分片再按句切
├── 复现论文成绩
│ ├── GitHub FreedomIntelligence/Apollo → bash 0.download_data.sh
│ └── XMedBench 下载注意坑 4(HI/AR 链接互换)
└── 只想引用数据集
├── 数据口径:3,741,196 行(pretrain_text 口径)/ 22.3 GB / 2.5B tokens
├── 引用条目:README BibTeX(坑 6 署名差异自知)或 arXiv abs v6
└── 语言表述:写"六语言(预训练发布五语言)"最稳妥
附录 E:术语表
| 术语 | 释义 |
|---|---|
| ApolloCorpus / ApolloCorpora | 同一语料的 HF 名(单数)与论文名(复数),坑 1 |
| Continue Pretrain(继续预训练) | 在已预训练基座上用领域语料续训,本语料的主设计用途 |
| QA-Augmented Pre-training | 用 ChatGPT 把预训练文本改写成医患问答对再训练,防指令能力遗忘(论文方法) |
| Mix Training | 预训练与指令数据混合采样、平滑过渡的训练编排 |
| Priority Sampling | 按权重 π 的动态采样:本配方 π=16(预训练)、π=2(指令) |
| Proxy-Tuning | 用小模型微调前后的 logit 偏移在推理时修正大模型,免改权重 |
| XMedBench | 配套六语言医疗多选基准(EN/ZH/ES/FR/HI/AR 六组件组) |
| FreedomIntelligence | 港中深 + 深圳大数据研究院的医疗 AI 团队(CMB/HuatuoGPT 同门) |
| medicalWeb | 论坛来源网络医疗内容分片(本语料最大单项 886.7M token) |
| medicalPatient | SFT 医患对话分片(ar/en/zh 三语言) |
| MAQA | 最大阿拉伯医疗问答数据集(Abdelhay & Mohammed 2022),AR 对话源头 |
| Huatuo_26M | 中文医疗指令数据集(Li et al. 2023b),ZH 对话源头之一 |
| cr:RecordSet | Croissant 元数据里的记录集节点(本条目 frontmatter 已按节点式写入) |
§14 库内互链详注:六个 rid 的连接逻辑
本节把 §7.3 的互链总表逐条展开——每条说明"为什么这两个条目应该互相引用"以及"联读时看什么"。rid 为库内 record_id(2026-09-28 只读核验)。
14.1 medmcqa(111) —— XMedBench-EN 的题源同门
MedMCQA 是印度医学入学考试(AIIMS/NEET-PG 体系)的多选题数据集,约 194k 题;在本条目语境里它身兼两职:其一是 ApolloCorpus 之外的独立评测组件(XMedBench-EN 三组件之一),其二是"考试题驱动医疗 LLM"路线的代表数据源。联读要点:ApolloCorpus 的 Exams-EN 分片(42.1M token)与 MedMCQA 同属考试题语料但规模口径不同——前者是 token 计的预训练/微调材料,后者是按题计的评测集;在 medmcqa 条目上训练的模型可用 XMedBench-EN 分数与本条目 Tab.3 直接对标。
14.2 headqa(120) —— 西班牙语侧的桥梁
HeadQA 源自西班牙医疗专业资格考试(SPANISH MD/PSY/CO/EN/NUR 考试),约 2.6k 题 × 多年版本;它是 XMedBench-ES 的唯一组件,也是 ApolloCorpus 六语言版图里"西班牙语医疗 AI"的评测锚点。联读要点:Apollo-6B 在 HEAD-QA 上 58.47、Apollo-7B 63.73(Tab.3 一手),而基座 Yi-6B 仅 47.01——西语侧的领域增益案例可以直接引这两行;在 headqa 条目讨论"西班牙语医学 QA 生态"时,本条目提供了把 HeadQA 用作多语言基准组件的范式样本。
14.3 cmb-cmexam(180) —— 既是上游又是基准
CMB(Chinese Medical Benchmark)与 CMB-Exam 是 FreedomIntelligence 团队的中文医疗考试资产;在 ApolloCorpus 里它是双向连接:训练侧,CMB 训练集被直接并入 Exams-ZH 分片(35.3M token);评测侧,CMB-single(随机抽 2,000 单选)进入 XMedBench-ZH 组件清单(论文未用,但 README 列出)。联读要点:用 cmb-cmexam 条目数据训练过的模型,若又在 XMedBench-ZH 上评测,存在训练-评测同源风险——这正是论文 §3.1 “Data Leakage Checking” 专节存在的原因;联读时关注库内 cmb-cmexam 条目的许可与切分说明,判断自家管线是否需要隔离。
14.4 pmc-oa(320) —— medicalPaper-EN 的量级参照
PMC-OA 是 PubMed Central 开放获取文献的图文语料集;ApolloCorpus 的 Papers-EN 分片(252.9M token)与之同域同源生态。联读要点:pmc-oa 提供"文献原文+图"的多模态视角,ApolloCorpus 的 paper 分片提供"纯文本+QA 改写"的训练视角——两者拼起来恰好覆盖"文献→模型"的两种数据形态;讨论 PMC 文本的许可层级(CC BY/CC BY-NC/CC BY-NC-ND 混合)时,可对照本条目 §5.1 的"发布许可≠底层文本版权"三层观。
14.5 s2orc(370) —— 大规模文献语料的对照系
S2ORC 是 Semantic Scholar 的开放学术全文语料(1.36 亿篇级);它与本条目的关系是"量级参照系":ApolloCorpus 全部六语言 2.5B tokens,尚不及 S2ORC 英文文献 token 的零头。联读要点:任何"要不要在 ApolloCorpus 之外再补 PMC/S2ORC 论文语料"的容量决策,可引用两者的数量级对比;S2ORC 无医疗策展,ApolloCorpus 的价值恰在策展层(词典过滤、长度过滤、QA 改写)——两者是"原料矿"与"精炼料"的关系。
14.6 meddialog(210) —— 医患对话的同类对照
MedDialog(英文+中文在线医疗对话)是本库医患对话类的代表条目;ApolloCorpus 的 Dialogues 分片(EN 92.1M + ZH 46.6M + AR 10.4M token)与之同类但来源不同:前者是在线问诊平台的真实对话,后者是"真实语料/题库改写+生成"的混合(EN 系 ChatGPT 从 PMC-Patients 改写、ZH 系 HuatuoGPT 资产、AR 系 MAQA 抽取)。联读要点:训练"医生口吻"模型时,meddialog 提供真实语体、ApolloCorpus 提供受控改写体——两者对风格迁移的贡献可做消融;§13.2 的"生成文本层/真实文本层"信任分级在两个条目间同样适用。
14.7 互链使用建议(编辑部口径)
- 上述六条均为双向建议互链:本条目出"多语言训练语料"视角,对侧出"单语种/单形态数据"视角。
- 引用 rid 时以库内 record_id 为准(111/120/180/320/370/210),条目 url_name 以
ai_ready_dataset表实时查询为准。 - 建议未来条目(如 MEDITRON、BioMistral、MMedLM2 若入库)反向链接本条目的 Tab.2 token 账本——该表是多语言医疗语料配比讨论的公共参照物。
§15 结语:一份语料的两种读法
作为数据的读法:ApolloCorpus 是 22.3 GB、六语言、Apache-2.0 的医疗文本原料库——英文/中文侧丰厚(书籍、论文、百科、指南、论坛五类俱全),西语侧够用,法/印地/阿拉伯语侧单薄;SFT 侧五类指令数据在六语言间基本铺齐。它不承诺均衡,只承诺可得。
作为方法的读法:它把"多语言医疗 LLM 怎么喂"的完整配方公之于众——token 账本精确到 0.1M、改写流水线固化为 _qa 文件、采样公式写出 π 值、五个基座的对照实验证明配方可迁移。对想要复刻"非英语医疗 LLM"的团队,这份配方的可复制价值不亚于数据本身。
两种读法合起来,是它在 AI-Ready 光谱上的位置:发布纪律接近满分(许可、格式、通道),数据审计留有空白(质量抽检、PII 流程、生成标注)。把它当原料与教材,收益最大;把它当"即插即用的成品知识库",需要带上 §8 的八个坑与 §13 的四条治理提示。
附录 F:Apollo 模型系规格卡(语料的下游产物,对照检索用)
| 模型 | 基座 | 架构家族 | XMedBench avg | 对话模板 | 发布物 |
|---|---|---|---|---|---|
| Apollo-0.5B | Qwen-0.5B | Qwen | 37.47 | User:/Assistant: + `<\ |
endoftext\ |
| Apollo-1.8B | Qwen-1.8B | Qwen | 44.74 | 同上 | HF 权重;亦作 proxy-tuning 代理 |
| Apollo-2B | Gemma-2B | Gemma | 39.94 | 同上 | HF 权重 + GGUF |
| Apollo-6B | Yi-6B | Yi | 57.54 | 同上 | HF 权重 + GGUF |
| Apollo-7B | Gemma-7B | Gemma | 58.78 | 同上 | HF 权重 + GGUF;论文旗舰 |
| Apollo-34B / 72B | (论文未附细节;模板为 Qwen 风格特殊 token) | 推断 Qwen 系 | 未入论文 Tab.3 | `<\ | User\ |
| Apollo-MedJamba | Jamba(AI21) | hybrid SSM-Transformer | 未入论文 | — | 2024-04-25 发布,独立 repo |
| ApolloMoE | MoE 架构 | — | 未入论文 | — | 2024-10-15 发布,宣称 50 语言 |
读表提示:① 五款正式模型的基座是"Qwen×2 + Gemma×2 + Yi×1"混合(坑 7);② Apollo-7B 增幅最小(+6.34)但绝对分最高——基座 Gemma-7B 本身多语言底子好;③ Apollo-0.5B 增幅最大(+18.30),"小模型吃领域语料性价比最高"结论即由此而来。
附录 G:XMedBench 组件 × 库内条目对应总表
| XMedBench 组件 | 语言 | 数据性质 | 库内条目(rid) | 关系 |
|---|---|---|---|---|
| MedQA-USMLE | EN | 美国医师执照考试题 | 无独立条目 | 论文评测组件;题源与 Exams-EN 同类 |
| MedMCQA | EN | 印度医学考试题 | medmcqa(111) | 直接对应——独立评测组件入库 |
| MMLU-Medical(六子集) | EN/HI/AR | 通用医学多选(HI/AR 为翻译版) | 无独立条目 | HI/AR 侧唯一评测源;医师校验翻译 |
| MedQA-MCMLE | ZH | 中国医师考试题 | 无独立条目 | ZH 评测组件 |
| CMMLU-Medical(七子集) | ZH | 中文医学多选 | 无独立条目 | ZH 评测组件 |
| CMB-single | ZH | 随机 2,000 单选 | cmb-cmexam(180) | 同源——README 列示、论文未用 |
| CExam | ZH | 随机 2,000 单选 | cmb-cmexam(180) | 同上 |
| HEAD-QA | ES | 西班牙卫生专业考试 | headqa(120) | 直接对应 |
| FrenchMedMCQA | FR | 法语医学考试 | 无独立条目 | FR 唯一评测组件 |
检索提示:从库内 medmcqa(111)/headqa(120) 条目进入的读者,可用本表"向上"找到它们在多语言医疗基准体系中的位置;从 ApolloCorpus 进入的读者,可"向下"把六语言评测拆解为单语种数据集逐一深究。
附录 H:Pilot Study 全表(Tab.1 转录)——多语言协同的一手证据
论文 §2.2 用 Qwen-1.8B 做了一组先导实验:同一批数据分别按"六语言各训一个单语模型"与"六语言混合训练"两种设置训练(XMedBench 六语言平均分):
| 设置 | EN | ZH | FR | ES | AR | HI | Avg |
|---|---|---|---|---|---|---|---|
| 基座 Qwen-1.8B | 32.91 | 40.07 | 22.12 | 27.43 | 23.71 | 8.82 | 25.84 |
| Apollo-English(单语) | 39.44 | 45.27 | 28.35 | 31.76 | 22.61 | 8.72 | 29.36 |
| Apollo-Chinese(单语) | 39.42 | 61.13 | 28.97 | 33.83 | 27.94 | 25.34 | 36.11 |
| Apollo-French(单语) | 30.94 | 32.71 | 23.81 | 27.00 | 24.54 | 1.74 | 23.46 |
| Apollo-Spanish(单语) | 33.84 | 43.81 | 27.41 | 35.39 | 28.40 | 23.88 | 32.12 |
| 混合多语言(Apollo 配方前身) | — | — | — | — | — | — | 见主表 44.74 |
三个结论(论文原文口径):① 单语训练除 Apollo-Chinese 外普遍弱于混合训练;② 最戏剧性的对照是 Apollo-French(23.46)甚至低于其基座(25.84)——法语侧数据稀薄时单语继续训练反而有害;③ 混合训练让 HI 从 8.82 升至显著水平、AR 从 23.71 同步受益——“多语言协同”(multilingual synergy)即指此现象。这组数字是"为什么低资源语言医疗 LLM 应该混合训练"的最简明引用源。
附录 I:检索与引用十误区(速排)
- 把 Apollo-6B 当"6B People"的 6B——前者是参数量,后者是语言覆盖人口(§2.3)。
- 把 ApolloCorpus 当评测基准——它是训练语料;评测用 XMedBench(两件套不同用途)。
- 引用 “An Lightweight” 旧标题——v6 已定稿 “A Lightweight”(坑 6)。
- 以为 22.3 GB 包含全部 qa 副本行数——3,741,196 行只是
_text侧口径(坑 3)。 - 按六语言预期找阿语预训练分片——没有,ar 仅 SFT(坑 2)。
- 顺 GitHub README 链接下 HI/AR 评测集——链接互换,会拿错语言(坑 4)。
- 给 Apollo-7B 套 Qwen tokenizer/模板——7B 基座是 Gemma-7B(坑 7)。
- 给 34B/72B 套 7B 对话模板——两套模板(坑 8)。
- 把 Apache-2.0 当底层文本版权豁免——三层许可观(坑 5、§13.4)。
- 把"2024.02.12 published"当 HF 上线日——HF repo createdAt 是 2024-03-06(坑 7 关联)。
附录 J:六类数据分片深读
J.1 medicalBooks —— 教科书质地的基础盘
规模与语言:413.8M tokens(EN 296.7M + ZH 117.1M),预训练侧第二大单项;HF 上 medicalBook_en 553k 行、medicalBook_zh 500k 行(viewer 口径,text 侧)。
内容质地:医学教材与专著文本——概念定义密集、行文体系化、术语规范。这是六类分片中最接近"教科书学习体验"的一类,也是 QA 改写收益最直观的一类(教材天然自带"知识点-解释"结构,改写成问答对后几乎无损)。
使用建议:领域继续预训练的打底料;做医学教育类应用(题库解析、概念解释)时优先取用;英文分片可与库内其他英文医学文献语料形成"教材+期刊"双轨。
注意事项:书籍文本的版权敏感性在六类中最高(附录 J 各类通用提示见 J.7);部分书籍文本可能含图表引用残留("如图 X 所示"类空指),做 RAG 时需清理。
J.2 medicalPapers —— 学术前沿的窄门
规模与语言:349.0M tokens(EN 252.9M + ZH 45.6M + ES 46.0M + FR 4.5M)——注意 ES 论文 token(46.0M)竟高于 ZH(45.6M),是西语侧预训练的意外主力。
内容质地:同行评审论文文本——摘要-方法-结果-讨论的结构性最强,术语密度最高,缩写最泛滥。对基座 tokenizer 的领域适应性要求也最高(新药名、基因名、计量单位)。
使用建议:提升模型"读文献"能力的核心料;与库内 pmc-oa(320)/s2orc(370) 联合使用时注意本分片可能与其重叠(论文未给去重清单),建议按 DOI/标题哈希先去重。
注意事项:法文论文仅 4.5M token——"法语医疗 LLM"的论文语料支撑主要就得靠这些,预期要放低。
J.3 medicalWikis —— 百科式概览与低资源现实
规模与语言:226.2M tokens(EN 221.1M + FR 4.6M + HI 0.5M);HF 行数 medicalWiki_en 239k、medicalWiki_fr 8.39k、medicalWiki_hi 209。
内容质地:医学百科条目——定义清晰、覆盖面广、深度中等。英文侧经词典过滤(36,107 个医学词条入选),是"概念对齐"的好材料;HI 侧 209 行的现状是印地语医学百科体量的诚实记录。
使用建议:RAG 库的"骨架层"(概念查询命中率高);做实体链接/术语归一时可用作词典补充;HI 分片建议只作存在性样本,不作为 HI 预训练主力。
注意事项:百科内容有版本时点(2024 年前后快照),医学指南更新的领域(如肿瘤治疗方案)需人工复核时效性。
J.4 medicalDialogues(论文口径)与 medicalPatient(HF 口径)—— 最特殊的一类
规模与语言:论文 Tab.2 记 149.1M tokens(EN 92.1M + ZH 46.6M + AR 10.4M)作继续预训练;HF 发布侧对应物是 SFT 的 medicalPatient_{ar,en,zh}.json——HF 的 pretrain 目录里没有对话分片(坑 2 的核心案例)。
内容质地:三源三性——EN 系 ChatGPT 从 PMC-Patients 病例报告改写的多轮问诊(合成度高、医学结构好);ZH 系 HuatuoGPT/Huatuo_26M 现成资产(真实问诊改写);AR 系 MAQA 真实问答的长度过滤子集(最接近真实患者语体)。
使用建议:训练"问诊语气"与多轮对话能力的主料;AR 侧若做预训练需回源 MAQA 自行补充原始文本。
注意事项:EN 对话的"患者叙述"由模型生成,含虚构病例细节——医疗事实抽取任务不要把它当真实病历(与库内 ehrsql/mimiciii 等真实 EHR 条目严格区分)。
J.5 medicalGuidelines —— 最小也最金贵
规模与语言:29.6M tokens,仅 EN;HF medicalGuideline_en 99.7k 行。
内容质地:临床实践指南文本——循证等级、推荐意见、剂量阈值高度密集,是六类中"单位 token 医疗决策价值"最高的一类,但也是低资源语言完全缺席的一类(几乎没有开放的非英文指南语料)。
使用建议:临床决策支持类应用的精饲料;做指南问答/RAG 时按"推荐意见段落"细粒度切块而非按行。
注意事项:指南有时效性(同一机构会撤换旧版),2024 年快照中的部分推荐可能已被更新——临床类产品必须配版本治理。
J.6 medicalWeb —— 最大的单项,最小的信任
规模与语言:886.7M tokens(EN 499.9M + ZH 329.3M + ES 57.5M),占全语料约 35%;HF 行数 medicalWeb_zh 641k、medicalWeb_en 394k、medicalWeb_es 153k。
内容质地:在线医疗论坛与问答(论文注明 “from online forum”)——患者叙事、经验分享、非专业提问与专业回答混杂。viewer 实拍样本(中文分片)显示内容为"癌症晚期食欲不振机制"类长科普贴,医学细节丰富(受体机制、药物副作用)但行文口语化、可靠性参差。
设计意图:作者明言这是刻意的——模拟医学生"核心课程之外的网络信息摄取",让模型适应真实互联网上患者实际会读到的文本分布。
使用建议:继续预训练可用(配比按论文);RAG 与直接面向患者的生成任务建议排除或降权;做医疗信息抽取研究时它反而是好素材(真实患者语体的 NLP 任务)。
注意事项:PII 风险六类中最高(患者自曝信息),§13.3 的扫描建议主要针对此类;论坛内容的原生许可状态最模糊。
J.7 六类速查总表
| 分片 | token | 语言 | HF 行数(text 侧) | 信任梯度 | 最佳用途 |
|---|---|---|---|---|---|
| medicalWeb | 886.7M | en/zh/es | 641k/394k/153k | 低 | 预训练配比、语体适应 |
| medicalBook | 413.8M | en/zh | 553k/500k | 中高 | 预训练打底、概念解释 |
| medicalPaper | 349.0M | en/zh/es/fr | 878k/177k/89k/8.28k | 高 | 文献理解、术语适应 |
| medicalWiki | 226.2M | en/fr/hi | 239k/8.39k/209 | 中高 | 概念对齐、RAG 骨架 |
| medicalDialogues/Patient | 149.1M | en/zh/ar | 见 SFT patient 文件 | 分层(AR 真实>EN 合成) | 对话能力、问诊语气 |
| medicalGuideline | 29.6M | en | 99.7k | 高 | 决策支持、RAG 精料 |
(信任梯度为编辑部基于"来源真实性×人工审核可见度"的定性评级,非论文口径。)
附录 K:论文相关工作 landscape(引用网络速览)
论文 Related Work 与引文图勾画的 2024 年初医疗 LLM 版图,按与本条目的关系分层:
| 层 | 工作 | 与 ApolloCorpus 的关系 |
|---|---|---|
| 英文医疗 LLM(单语深挖) | Meditron-70B、PMC-LLaMA、MedAlpaca、BioMedLM、BioGPT | 对照组:证明"英文中心"路线在非英语侧失效,反衬本语料的多语言定位 |
| 中文医疗 LLM | HuatuoGPT(I/II)、DoctorGLM 等 | 既有资产复用(ZH 对话/考试直接并入)+ 对照组(Huatuo2-7B/13B 入 Tab.3) |
| 多语言先驱 | BioMistral(多语言评测)、BiMediX(双语)、MMedLM/MMedLM2(EN/ZH)、Medical mT5 | 同赛道:语言数、数据开放度、模型规模三维对比的对手席 |
| 评测供给 | MedQA(USMLE/MCMLE)、MedMCQA、HeadQA、FrenchMedMCQA、MMLU、CMB | XMedBench 的组件来源;库内 medmcqa(111)/headqa(120)/cmb-cmexam(180) |
| 数据供给 | PMC-Patients、Huatuo_26M、MAQA、ShareGPT、Alpaca、WizardLM、belebele、ai2_arc、Capybara | 语料的上游拼图(§7.1) |
| 训练技术 | proxy-tuning(Liu et al. 2021 反专家法)、continue-pretraining 文献 | Proxy-Tuning 章节的学术根基 |
后续引用网络(arxiv.gg/Google Scholar 口径,2026-09-28):Aqulia-Med、Me LLaMA、MedGemma 技术报告、Large Language Models 相关综述、Med-CoReasoner 等工作引用本论文——ApolloCorpus 与 XMedBench 已成为多语言医疗 LLM 论文的标准对照物。
附录 L:复现工程清单(从零到跑通)
以下清单按"论文复现流水线"整理(GitHub README 七步 + 论文超参),供数据工程侧直接取用:
- 环境:repo 要求见 requirements.txt;多节点训练脚本在 scripts/multi_node_train_*.sh。
- 取数:
bash 0.download_data.sh(2024-09-13 更新版)——拉取 ApolloCorpus 并按模型整理;或手动 HF 下载(§5.2 三通道)。 - 评测集构造:
bash 1.data_process_test\&dev.sh——按目标基座的特殊 token 构造 test/dev;用 ./util/check.ipynb 校验 special tokens。 - 训练集构造:
bash 2.data_process_train.sh——预分词 + 训练顺序/epoch 调整(此处可注入 §4.3 的采样策略)。 - 训练:
bash 3.single_node_train_gemma.sh(Gemma-2b 示例);batch 256、lr 1e-5(论文设定)。 - (可选)Proxy-Tuning:
bash src/proxy-tuning/scripts/eval/proxy_tuning.sh——小模型对(基座+Apollo)作 logit 偏移。 - 评测:
bash 4.eval.sh生成基准分数;协议:3-shot、正则抽选项、生成 2-128 tokens、0.5B 全精度其余半精度。 - 对数:跑完与论文 Tab.3 对应行核对(Apollo-7B 58.78 为旗舰锚点);偏差大时优先排查坑 4(HI/AR 数据拿错)与坑 8(模板用错)。
三条经验提示:① viewer 的 13 splits 只是 _text 侧,复现要记得补 _qa;② medicalExam 有 _clean/_dup 变体,直接用 _clean;③ 阿语侧按论文叙述补 MAQA 原始文本,否则 AR 分数复现会低于论文(坑 2 的训练侧后果)。
附录 M:HF API 元数据全字段转录(一手 JSON,2026-09-28)
以下为 hf-mirror.com/api/datasets/FreedomIntelligence/ApolloCorpus 返回的关键字段原样转录(省略无关字段),供复核与追溯:
| 字段 | 值 |
|---|---|
| id | FreedomIntelligence/ApolloCorpus |
| author | FreedomIntelligence |
| sha | c1ee58d62a26a2422d01749517435fb0d716d449 |
| lastModified | 2024-09-13T16:45:12.000Z |
| private / gated / disabled | false / false / false |
| tags | license:apache-2.0 · size_categories:1M<n<10M · format:json · modality:text · library:datasets · library:pandas · library:polars · library:mlcroissant · arxiv:2403.03640 · region:us |
| downloads(API 时点) | 1,242 |
| likes | 41 |
| createdAt | 2024-03-06T13:03:28.000Z |
| usedStorage | 39,147,380,685 bytes |
| cardData.license | apache-2.0 |
| cardData.configs | config_name: pretrain_text · 13 个 split(data_files 指向 train/pretrain/*_text.json) |
config pretrain_text 的 13 个 split → 文件映射(原样):medicalBook_en → train/pretrain/medicalBook_en_text.json;medicalBook_zh → …_zh_text.json;medicalGuideline_en;medicalPaper_en/es/fr/zh;medicalWeb_en/es/zh;medicalWiki_en/fr/hi——即预训练 text 侧五语言 × 五源的全部组合中已发布的 13 个(books 缺其他语言、guideline 仅 en、wiki 仅 en/fr/hi——未发布的组合在 HF 上无文件,与论文 Tab.2 的语言矩阵存在缺口,坑 2 的文件级证据)。
siblings 文件清单全貌(共 66 项,归类):根目录 .gitattributes / README.md / ApolloCorpus.zip + assets 图 3 件 + check_exam 脚本 5 件(en/es/fr/zh 四语检查脚本 + questions/ 六语言题集 JSON:ar/en/es/fr/hi/zh)+ train/pretrain/ 22 件(11 组源-语言 × text/qa)+ train/question_dup.py + train/sft/ 33 件。预训练 11 组而非 13 组:qa 侧无 medicalGuideline_en_qa、medicalWiki_hi_qa 之外另有 1 组缺失(guideline 无 qa 对)——即 _text 13 splits、_qa 11 文件,两口径差 2。
SFT 33 件明细:code_en/code_zh(2)+ general_{ar,en,es,fr,hi,zh}(6)+ math_en/math_zh(2)+ medicalExam_{en,es,fr,zh} 各 4 变体(原始/_clean/_dup/dup_question,16)+ medicalPatient(3)+ 配套脚本若干。general 是唯一六语言齐全的 SFT 类,medicalPatient 三语言(ar/en/zh),math/code 双语(en/zh),medicalExam 四语(en/es/fr/zh)。
附录 N:论文 Tab.3 完整转录——21 模型 × 六语言分数全表
以下为论文 Tab.3 的完整一手转录(3-shot,正则抽取,百分比)。列序:EN=USMLE/MedMCQA/MMLU♢;ZH=MCMLE/CMMLU♢;FR=FrenchMedMCQA;ES=HEAD-QA;AR=MMLU♢;HI=MMLU♢;Avg。(♢ 为 MMLU 医学子集组合)
| 模型 | USMLE | MedMCQA | MMLU | MCMLE | CMMLU | FrenchMedMCQA | HEAD-QA | MMLU(AR) | MMLU(HI) | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| 闭源 | ||||||||||
| GPT-4 | 79.10 | 70.40 | 86.00 | 65.72 | 65.72 | 89.72 | 85.05 | 56.43 | 62.17 | 73.37 |
| GPT-3.5 | 61.98 | 56.51 | 72.94 | 58.73 | 50.41 | 68.54 | 71.48 | 39.70 | 39.94 | 57.80 |
| 开源 >70B | ||||||||||
| Qwen-72B | 64.10 | 62.16 | 78.46 | 91.68 | 81.47 | 74.14 | 76.62 | 46.87 | 43.16 | 68.74 |
| Meditron-70B | 55.70 | 50.87 | 69.59 | 48.34 | 40.29 | 53.27 | 59.74 | 19.30 | 31.31 | 47.60 |
| Llama-2-70B | 32.99 | 48.29 | 64.62 | 25.80 | 25.13 | 50.47 | 54.34 | 1.65 | 26.35 | 36.63 |
| 开源 7-34B | ||||||||||
| Qwen-14B | 50.27 | 45.83 | 61.68 | 75.22 | 61.82 | 49.53 | 60.81 | 36.58 | 32.29 | 52.67 |
| Yi-34B | 62.45 | 60.60 | 71.86 | 26.12 | 26.51 | 66.04 | 69.99 | 30.70 | 9.73 | 47.00 |
| 开源 7B 级 | ||||||||||
| Gemma-7B | 53.42 | 50.94 | 70.15 | 48.95 | 43.29 | 57.63 | 62.79 | 36.21 | 48.58 | 52.44 |
| MMedLM2-7B | 55.46 | 50.49 | 68.15 | 64.30 | 56.11 | 58.57 | 62.14 | 23.53 | 24.15 | 51.45 |
| Mistral-7B | 47.29 | 47.38 | 62.80 | 38.32 | 34.21 | 50.78 | 51.93 | 28.40 | 27.36 | 43.16 |
| Qwen-7B | 32.36 | 39.52 | 53.22 | 54.32 | 44.71 | 37.69 | 45.05 | 28.31 | 24.89 | 40.01 |
| Zephyr-7B-β | 41.95 | 42.48 | 58.74 | 36.11 | 31.88 | 46.42 | 46.77 | 27.02 | 27.92 | 39.92 |
| BioMistral-7B | 41.79 | 42.05 | 54.46 | 34.65 | 31.43 | 43.61 | 44.66 | 27.11 | 22.96 | 38.08 |
| Huatuo2-7B | 37.86 | 36.58 | 42.49 | 55.08 | 43.81 | 27.41 | 33.88 | 25.92 | 27.46 | 36.72 |
| Huatuo2-13B | 29.77 | 36.58 | 42.86 | 56.07 | 45.46 | 22.42 | 36.13 | 18.29 | 13.59 | 33.46 |
| Llama-2-7B | 32.13 | 36.58 | 40.14 | 25.39 | 25.13 | 29.60 | 33.54 | 21.42 | 27.27 | 30.13 |
| Meditron-7B | 33.78 | 34.54 | 36.18 | 27.50 | 27.16 | 24.00 | 32.81 | 1.65 | 18.27 | 26.21 |
| PMC-Llama-7B | 20.11 | 23.12 | 19.72 | 16.90 | 16.73 | 17.13 | 18.68 | 9.65 | 2.85 | 16.10 |
| 本语料产物 | ||||||||||
| Apollo-0.5B | 32.99 | 37.82 | 45.87 | 56.57 | 42.08 | 27.41 | 36.67 | 31.89 | 25.90 | 37.47 |
| Apollo-1.8B | 42.18 | 44.99 | 49.12 | 72.30 | 53.56 | 38.01 | 42.15 | 34.74 | 25.62 | 44.74 |
| Apollo-2B | 38.33 | 42.00 | 52.89 | 46.76 | 36.76 | 38.32 | 41.28 | 31.62 | 31.50 | 39.94 |
| Apollo-6B | 56.25 | 57.53 | 68.65 | 85.52 | 72.62 | 51.71 | 58.47 | 33.46 | 33.61 | 57.54 |
| Apollo-7B | 56.00 | 58.21 | 71.86 | 72.36 | 59.04 | 60.44 | 63.73 | 41.82 | 45.55 | 58.78 |
全表可读出的四个结构信号(编辑部注):
- HI 列是"翻译基准照妖镜":基座家族的 HI 分数方差极大(Yi-34B 9.73 vs Gemma-7B 48.58)——同一翻译版 MMLU-HI 上,模型家族的印地语 tokenizer/预训练配比差异被放大;Apollo-7B 45.55 说明 Gemma 系底子被语料保住了。
- 医疗 SFT 不必然提升非英文分数:Huatuo2-13B(33.46)低于其同门 Huatuo2-7B(36.72)、Meditron-7B(26.21)低于 Llama-2-7B(30.13)——单语医疗微调可能损害低资源语言,反衬混合训练路线。
- HEAD-QA(ES)是最"便宜"的涨分点:多数 7B 模型在 HEAD-QA 上分数高于其英文 USMLE 分数(如 Gemma-7B 62.79 vs 53.42),Apollo 系亦然——西语侧竞争密度低。
- Apollo-0.5B 的 AR/HI(31.89/25.90)甚至超过若干 7B 模型——小模型 + 多语言混合语料在低资源语言上的性价比异常突出,与 §6.2 的"基座越弱增益越大"互证。
附录 O:语料内嵌题集与检查脚本(check_exam/,易被忽略的资产)
HF siblings 里有一组常被忽略的文件:check_exam/ 目录(5 件)。它们是团队自用的"考试题健康检查"工具链,对复现者有直接价值:
| 文件 | 内容 | 用途 |
|---|---|---|
| check_exam/check_en.py | 英文考试题检查脚本 | 校验 exams 分片格式/答案分布 |
| check_exam/check_es.py | 西语版 | 同上(ES) |
| check_exam/check_fr.py | 法语版 | 同上(FR) |
| check_exam/check_zh.py | 中文版 | 同上(ZH) |
| check_exam/questions/ar_question.json | 阿语题集 | 六语言题集里唯一以 JSON 随库发布的 AR 侧数据——AR 预训练缺席(坑 2)背景下,这是 AR 在 pretrain/辅助文件层仅有的存在 |
| check_exam/questions/{en,es,fr,hi,zh}_question.json | 其余五语题集 | 与 XMedBench 组件对照用 |
| train/question_dup.py | 题干去重脚本 | medicalExam_*_dup/_clean 变体文件的生成器(§12-Q4 的流程实证) |
三个推论:① question_dup.py 的存在证实 medicalExam 的 _dup/_clean/_dup_question 三变体出自程序化去重(而非手工筛选);② 检查脚本只覆盖 en/es/fr/zh 四语——HI/AR 考试题没有专用检查器,与其"翻译基准"的从属地位一致;③ 想审计 exams 分片质量的复现者可直接跑这组脚本,不必重写。
附录 P:库内医疗 NLP/问答条目关系矩阵(ApolloCorpus 视角)
以本语料的"文本语料+考试题+对话"三视角扫描库内相关条目(url_name 与 rid 以 2026-09-28 只读查询为准;未列 rid 者为建议未来互链的潜在对象):
| 库内条目 | 类型 | 与 ApolloCorpus 的关系 | 联读价值 |
|---|---|---|---|
| medmcqa(111) | 考试题 | XMedBench-EN 组件 | 训练/评测同源对照 |
| headqa(120) | 考试题 | XMedBench-ES 组件 | 西语侧锚点 |
| cmb-cmexam(180) | 考试题 | Exams-ZH 上游 + XMedBench-ZH 同源 | 泄漏检查案例 |
| meddialog(210) | 对话 | Dialogues 分片同类 | 真实语体 vs 改写语体 |
| pmc-oa(320) | 文献 | Papers-EN 同域 | 图文 vs 纯文本 |
| s2orc(370) | 文献 | Papers 的量级参照 | 原料矿 vs 精炼料 |
| mednli | 推理 | NLI 任务视角——语料 QA 对可改造为蕴含/中立/矛盾三元组 | 任务迁移 |
| emrQA | 问答 | EHR 问答生成框架——语料 QA 对的另一种生产路径对照 | 问答生成方法论 |
| MedQuAD | 问答 | 真实患者问答(爬取)vs 本语料生成 QA | 信任分层素材 |
| medicationqa | 问答 | 用药问答子域——general/medicalPatient 分片的子域透视 | 子域评测 |
| healthsearchqa | 问答 | 搜索query式患者提问 vs 论坛分片语体 | medicalWeb 语体对照 |
| pathvqa / slake / vqa-rad / omnimedvqa | 多模态 VQA | 本语料纯文本路线的对偶(影像问答) | 模态光谱两端 |
| rxqa | 药学问答 | 药学子域——语料 papers/books 分片的药学密度评估 | 子域深耕 |
| maccrobat / maccrobat 类标注集 | 标注 NLP | 实体/关系标注 vs 本语料无标注预训练 | AI-Ready 光谱对照 |
| litilot/litcovid 等文献标注 | 文献标注 | COVID 文献标注——papers 分片的时效子集对照 | 主题纵深 |
矩阵读法:本语料在库内"AI-Ready 光谱"上占据**“无标注/生成增强/多语言/预训练级”**的极端位置——与标注型条目(人工标签逐例可信)构成光谱两极,与考试题型条目(天然结构化)构成中间态。任何讨论"医疗数据 AI-Ready 程度"的条目都可以引本条目作端点样本。
附录 Q:九个月时间线纵深(2024.01-2024.10)
把 §2.2 的时间线按产品节奏重读一遍,能看到一个清晰的"三波发布"策略:
第一波(2024.01-02):占位。 repo 先行(01.23),语料与基准随后(README 口径 02.12)——先声明存在权,占住"多语言医疗 LLM"的叙事空位。此时论文未发、模型未挂,是典型的"先圈地后施工"。
第二波(2024.03):学术背书。 论文 v1(03.06)与 HF 数据集 repo(03.06 13:03 UTC)同日落场——注意 HF createdAt 精确到与 arXiv v1 同日,README 的 “02.12 published” 与 HF 实际创建时间的 22 天差,最合理的解释是"对外宣布日"与"仓库实际就绪日"之分(坑 7 的成因假说)。
第三波(2024.04-10):生态扩散。 MedJamba(04.25,架构嫁接)→ 数据集最后一次修改(09.13,修复性维护)→ 论文 v6(10.12,标题与作者定稿)→ ApolloMoE(10.15,50 语言叙事升级)。语料本体在 09.13 后冻结,团队重心转向 MoE——此后 ApolloCorpus 从"进行时"变成"完成时",成为后来者的静态参照物。
这九个月的节奏对数据集工程的启示:语料发布的"冻结点"宜选在下游生态(模型/基准/脚本)稳定之后——Apollo 团队把最后一次数据修改(09.13)放在 MedJamba 之后、ApolloMoE 之前,避免了"下游引用持续失效"的经典尴尬。
附录 R:六语言逐语对账卡
以下六卡按论文 Tab.2 + HF API 一手数字逐语言对账(CP=Continue Pretrain,IT=Instruction Tuning;占比按全语料 2,536.3M 计)。
R.1 英语 EN — 1,657.0M token(65.3%)
- 对账:CP 1,392.3M(Books 296.7 + Papers 252.9 + Encyclopedias 221.1 + Web 499.9 + Dialogues 92.1 + Guidelines 29.6)+ IT 264.7M(Exams 42.1 + General 194.5 + Math 18.9 + Code 9.2)。
- HF 文件:预训练五源全齐(paper_en 878k 行为全库最大分片),qa 侧缺 guideline_qa;SFT 五类全齐。
- 质地:唯一六类俱全的语言;指南分片(29.6M)全球语料独此一份。
- 使用建议:当作"主线语料"用;与其他语料(pmc-oa、s2orc)混用前先去重。
- 坑位关联:坑 5(版权敏感分片集中在 EN)。
R.2 中文 ZH — 654.2M token(25.8%)
- 对账:CP 538.6M(Books 117.1 + Papers 45.6 + Web 329.3 + Dialogues 46.6)+ IT 115.6M(Exams 35.3 + General 69.4 + Math 3.7 + Code 7.2)。
- HF 文件:book/paper/web 的 text+qa 成对,dialogues 走 SFT patient_zh;无 wiki/guideline 分片。
- 质地:Web 分片(329.3M)是 ZH 侧最大单项——论坛体质地;对话与考试直接继承 HuatuoGPT/CMB 资产,原生质量有背书。
- 使用建议:与团队前作(HuatuoGPT 系)对照取用,避免重复导入同一批对话数据。
- 坑位关联:与库内 cmb-cmexam(180) 联用注意同源去重。
R.3 西班牙语 ES — 122.4M token(4.8%)
- 对账:CP 103.5M(Papers 46.0 + Web 57.5)+ IT 18.9M(Exams 0.5 + General 18.4)。
- HF 文件:paper_es(89k 行)、web_es(153k 行)+ SFT 三件(general/exam/patient)。
- 质地:无 book/wiki/guideline——ES 侧"预训练深度"有限,论文论文分片(46.0M)略超中文论文分片,是个反直觉细节。
- 使用建议:六语言中"性价比第三"——有评测锚(HeadQA,Apollo-7B 得 63.73)与可用训练料,适合做西语医疗 LLM 的起点。
- 坑位关联:headqa(120) 直接对标。
R.4 法语 FR — 29.2M token(1.2%)
- 对账:CP 9.1M(Papers 4.5 + Encyclopedias 4.6)+ IT 20.1M(Exams 0.1 + General 20.0)。
- HF 文件:paper_fr(8.28k 行)、wiki_fr(8.39k 行)+ SFT 三件。
- 质地:预训练侧六语言最薄;pilot study 中 Apollo-French 单语训练(23.46)甚至低于基座(25.84)——法语料稀缺到"单语深训有害"的程度。
- 使用建议:必须混合训练,勿单语续训;补料方向:FrenchMedMCQA 之外的法语医学开放语料。
- 坑位关联:附录 H 的 Tab.1 法语行是"数据稀缺反噬"的引用源。
R.5 印地语 HI — 44.4M token(1.8%)
- 对账:CP 0.5M(Encyclopedias 0.5,HF 仅 209 行)+ IT 43.9M(General 43.9)。
- HF 文件:wiki_hi(209 行,全库最小分片)+ general_hi + 无 patient/exam/math/code。
- 质地:预训练几乎为零、SFT 全靠 general 顶——"预训练 0.5M + 指令 43.9M"的倒挂结构是六语言中独一份。
- 使用建议:只做指令微调目标语言;预训练靠混合语料的迁移效应(附录 H:混合训练使 HI 从 8.82 大幅受益)。
- 坑位关联:坑 4(README 的 HI 评测链接指向阿语集)。
R.6 阿拉伯语 AR — 29.1M token(1.1%)
- 对账:CP 10.4M(Dialogues 10.4——论文有账、HF 无文件)+ IT 18.7M(General)+ patient(未计入 Tab.2 的 IT 拆列)。
- HF 文件:仅 general_ar + medicalPatient_ar;check_exam/questions/ar_question.json 是 AR 在辅助文件层唯一存在(附录 O)。
- 质地:对话源自 MAQA 真实问答(>128 字符过滤),质量上限高但量小;预训练实物缺席是六语言中唯一。
- 使用建议:补课清单——从 MAQA 拉原始文本自建 AR 预训练分片;评测用 MMLU_Ara(翻译版,原生性弱)。
- 坑位关联:坑 2 的主角;坑 4 另一头。
R.7 六卡总览
| 语言 | 总 token | 占比 | CP/IT 结构 | HF 预训练分片 | 一句话评级 |
|---|---|---|---|---|---|
| EN | 1,657.0M | 65.3% | 1392.3/264.7 | 五源全齐 | 主线,几乎无短板 |
| ZH | 654.2M | 25.8% | 538.6/115.6 | 四源(缺 wiki/guideline) | 强,借力团队前作 |
| ES | 122.4M | 4.8% | 103.5/18.9 | paper+web | 够用,有评测锚 |
| HI | 44.4M | 1.8% | 0.5/43.9 | wiki 209 行 | 结构倒挂,纯指令依赖 |
| FR | 29.2M | 1.2% | 9.1/20.1 | paper+wiki | 最薄,单语训练有害 |
| AR | 29.1M | 1.1% | 10.4/18.7 | 无(论文有账) | 宣传与实物落差最大 |
附录 S:外部抓取存照(核验流水账,2026-09-28)
本条目全部事实的取证记录,按抓取动作逐一存照(工具、URL、结果),供复核者重放:
| # | 动作 | 对象 | 结果 |
|---|---|---|---|
| S1 | WebSearch | FreedomIntelligence ApolloCorpus 数据集 | 命中 HF 页面快照:3,741,196 rows / 22.3 GB / downloads 1,529 / likes 41 / pretrain_text 13 splits 行数分布 / 数据卡"Covering English, Chinese, French, Hindi, Spanish, Hindi, Arabic"原文 |
| S2 | WebFetch | arXiv abs 页 | 12 作者、v1-v6 日期链、DOI、摘要全文、“Comments: Preprint” |
| S3 | WebFetch | hf-mirror.com 数据集页 | 被重定向提示页拦截(跳回原站)→ 改走 API(S5) |
| S4 | WebFetch | arXiv HTML v6 / v4 / ar5iv | 三次均返回空内容 → 改 curl(S6) |
| S5 | WebFetch | hf-mirror.com/api/datasets/FreedomIntelligence/ApolloCorpus | 一手 JSON 全字段:license apache-2.0、usedStorage 39,147,380,685 B、createdAt、lastModified、13 splits data_files、66 项 siblings ✓ |
| S6 | curl -A UA | arxiv.org/html/2403.03640v6 | 270,362 字节 HTML 落地 /tmp,python 解析出:2.5B tokens 原句、Tab.2 token 账本、Tab.3 完整 21 模型表、Tab.4 消融、π=16/2、batch 256/lr 1e-5、36,107 词条、MAQA/HuatuoGPT/PMC-Patients 溯源、6.1B 人口脚注 ✓ |
| S7 | WebFetch | github.com/FreedomIntelligence/Apollo | README 全文:时间线五事件、usage format 双模板、XMedBench 清单(HI/AR 链接互换存照)、GGUF 致谢、BibTeX ✓ |
| S8 | WebFetch | apollo.llmzoo.com | fetch failed(T1 存照,主页未直核) |
| S9 | WebSearch | 论文 token 数 + 基座 | Lacuna/Tiptree 与 BearPlex 二手转述:2.5B token(与 S6 一致)、“Qwen backbone”(与 S6 Tab.3 冲突→坑 7)、proxy-tuning ≈3 分(转述口径) |
| S10 | hf-mirror API | /papers/2403.03640 | 重定向提示页拦截,未取到(无关键损失,S6 已覆盖) |
| S11 | bash scripts/qf_psql.sh | SELECT record_id,url_name,status FROM ai_ready_dataset WHERE url_name ILIKE '%apollo%' |
(0 rows)——库内无 apollo 条目 ✓ |
| S12 | bash scripts/qf_psql.sh | IN 查询候选互链条目 | medmcqa 111 / headqa 120 / cmb-cmexam 180 / meddialog 210 / pmc-oa 320 / s2orc 370 / panda-plus 640 ✓ |
| S13 | ls writing/ | 全库条目目录清单 | 无同名目录;确认互链候选存在性 ✓ |
| S14 | HF 页面快照 viewer | pretrain_text/medicalWeb_zh?p=312 | 样本实拍:癌症食欲不振机制长文,text 长度 32-34.7k 字符 ✓ |
环境备忘:HuggingFace 主站与 apollo.llmzoo.com 在本沙箱不可直连(S3/S8/S10 三次失败);hf-mirror.com 的 API 路径与 arXiv 直连稳定可用;GitHub 页面直连正常。
附录 T:检索 query 与命中对照(给后来者的搜索地图)
为"下一版修订者"与同主题检索者存的 query-命中对照(均 2026-09-28 实测):
| 检索意图 | 推荐 query | 命中质量 |
|---|---|---|
| 数据集本体规模 | FreedomIntelligence ApolloCorpus rows size |
优——HF 页面快照直接给出 rows/GB |
| 论文与模型系 | Apollo 2403.03640 multilingual medical LLM |
优——abs 页 + 多个镜像解读 |
| token 规模 | ApolloCorpora 2.5B tokens medical |
良——需进 HTML 全文核原句 |
| 基座构成 | Apollo 7B base model Gemma Qwen Yi |
中——二手多误传"Qwen backbone",必须回 Tab.3 |
| 阿拉伯语数据 | ApolloCorpus Arabic MAQA medicalPatient |
中——HF 文件树是唯一权威,搜索少有直达 |
| XMedBench 组件 | XMedBench MMLU_HI MMLU_Ara FrenchMedMCQA |
良——GitHub README + 论文 §4.1 |
| 引用条目 | wang2024apollo bibtex |
优——README 原文(注意坑 6 少两人) |
| 中文语境 | 阿波罗 医疗大模型 多语言 港中深 |
弱——中文报道稀少,建议直接读英文一手 |
检索纪律三条:① 任何"规模/语言/基座"结论必须落到 S5(HF API)或 S6(论文 HTML)两个一手源之一;② 二手转述(S9 类)只允许用于存照,不得直接进正文硬数字;③ HF 主站不可达时一律换 hf-mirror.com 同路径,不要降级为纯搜索快照。
附录 U:术语中英对照与首现速查
正文以中文为主、术语首现标英文;本表汇总全部关键术语的中英对照与正文首现位置(§ 号),供翻译、审校与跨条目引用对齐:
| 中文术语 | 英文原文 | 首现 | 备注 |
|---|---|---|---|
| 继续预训练 | continued pre-training (CP) | §0 | 本语料主用途;与"从头预训练"区分 |
| 指令微调 | supervised fine-tuning (SFT) | §0 | 训练阶段二;HF 的 train/sft/ 目录名即此 |
| 问答增强预训练 | QA-Augmented Pre-training | §0 | 论文核心方法一;_qa 文件的来源 |
| 混合训练 | Mix Training | §0 | 论文核心方法二 |
| 优先采样 | priority sampling | §4.3 | 公式 P_t(x)=π(x)/Σπ(y);π=16/2 |
| 代理微调 | proxy-tuning | §0 | 论文核心方法三;logit 偏移法 |
| 多语言医疗大语言模型 | multilingual medical LLM | 导语 | 项目总定位 |
| 医学多选题问答 | medical multiple-choice question answering (MCQA) | §6 | XMedBench 全部组件的任务形态 |
| 基座模型 | base / backbone model | §6.2 | Tab.3 的配对左列;忌译为"骨干网络"(那是 CNN 语境) |
| 数据泄漏检查 | data leakage checking | §4.4 | 论文 §3.1 专节名 |
| 文本与数据挖掘 | text and data mining (TDM) | 坑 5 | 版权例外条款的通行缩写 |
| 医患对话 | doctor-patient dialogues | §3.2 | Dialogues 分片;HF 侧名为 medicalPatient |
| 低资源语言 | low-resource languages | §0 | HI/AR/FR 在本语料语境下的实际地位 |
| 翻译基准 | translated benchmark | §6.1 | MMLU_HI/MMLU_Ara 的生成方式;与"本源基准"相对 |
| 本源基准 | native benchmark | §6.1 | HeadQA、FrenchMedMCQA、MedQA 系等 |
| 冻结发布 | frozen release | §5.4 | 2024-09-13 后不再修改的状态 |
| 生成文本层 | model-generated text layer | §13.2 | 编辑部治理分级术语(非论文原词) |
| 信任梯度 | trust gradient | 附录 J | 编辑部定性评级术语(非论文原词) |
| AI-Ready 光谱 | AI-Ready spectrum | §11.2 | 库内条目体系的通行分析框架 |
| 归一化 token 账本 | token ledger | §3.2 | 指论文 Tab.2 的分语言分来源统计 |
翻译与引用提示:论文标题中的 “Lightweight” 官方中文语境常译"轻量级";“Democratizing Medical AI to 6B People” 建议译"让医疗 AI 惠及 60 亿人"(数字指语言覆盖人口,见 §2.3);“ApolloCorpora” 在中文行文里建议保留原文不译,避免与希腊神话"阿波罗"混淆。
表内"首现"列为 § 编号(附录内容以附录字母标记)。审校时若增删术语,请同步更新本表行序——本表按正文出现顺序排列,是全条目术语的单一事实源(single source of truth);跨条目引用时以本表译名为准,避免同库异译。
(附录 U 完)
附记:成稿过程存照(并发写入事故与处置)
本条目成稿期间发生一次**/tmp 临时文件池并发写入冲突**,按库内存照文化如实记录全程与处置:
- 现象:agent-a-apollocorp 按 §0 三查约定以
/tmp/apollocorpus_agent-a-apollocorp_part*.md唯一化命名直写 part1-12;23:56 第一次拼接(841 行)后继续追加 part13-16 时,发现 part2/3/4/5 已被另一进程以另一章节体系(“§2 数据构成与规格”“§10 检索与使用坑位:九则”"附录 E:扩展问答(11-30 问)"等,合计多出约 200 行异源内容)覆盖;时间戳交叉显示双方在 23:50-23:58 窗口内互相覆写(对方 part6/7/8 写入时间甚至早于本代理 part4)。锁文件writing/apollocorpus/.lock(本代理名,23:33 建立)全程未被对方尊重或检查。 - 危害评估:若未发现,成稿将是两个代理产物的混合体(1187 行的中间版实际混入了异源章节,章节序号 §14/§15 与 §16 错序)。
- 处置:① 弃用 /tmp 共享池,改在本代理锁保护目录内建私有 part 区(
writing/apollocorpus/.parts_agent-a-apollocorp/);② 逐文件以特征串鉴别归属(INFOBOX/BibTeX 坑 6/13.5 节等特征句),确认 part1/6/9/10/11/12 为本代理原文后拷入私有区;③ part2/3/4/5/7/8 按本代理上下文中的原文全量重写;④ 重拼并逐节核对章节序(§0-§15 + 附录 A-U + 参考资料 + 编辑记录,无一错序);⑤ 事故过程写入本附记与编辑记录。 - 建议:/tmp part 唯一化约定在"同名代理多实例"场景下不设防——建议后续任务头的三查条款增加一条:part 文件直写工作目录锁内私有区,/tmp 仅作一次性中转或彻底不用;拼接前增加"章节序完整性校验"步骤。
- 责任声明:本附记仅记录现象与处置;对方进程身份不明(ps 快照仅见 3 个 --prewarm 预热进程与当前会话 shell),不做归因推断。
参考资料
- Wang, X., Chen, N., Chen, J., et al. Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People. arXiv:2403.03640 (v1 2024-03-06, v6 2024-10-12). https://arxiv.org/abs/2403.03640
- FreedomIntelligence. ApolloCorpus dataset card. HuggingFace. https://huggingface.co/datasets/FreedomIntelligence/ApolloCorpus (API:
/api/datasets/FreedomIntelligence/ApolloCorpus,抓取 2026-09-28) - FreedomIntelligence. Apollo GitHub repository(README 时间线、usage format、XMedBench 清单). https://github.com/FreedomIntelligence/Apollo
- FreedomIntelligence. XMedBench dataset. https://huggingface.co/datasets/FreedomIntelligence/XMedbench
- 论文 HTML 全文(v6):https://arxiv.org/html/2403.03640v6 (Tab.2 token 账本、Tab.3 基座配对、Tab.4 消融、Fig.5 改写 prompt)
- 项目主页(Demo):https://apollo.llmzoo.com/ (本次抓取失败,存照 T1)
- GGUF 量化版致谢 mradermacher:https://huggingface.co/FreedomIntelligence/Apollo-7B-GGUF
- 第三方转述(仅存照用):Lacuna/Tiptree Systems 论文解读页;BearPlex Apollo 技术评述页
- Google Scholar 引用页(被引 71,2026-09-28 快照);arxiv.gg(Cited by 19)
编辑记录
| 日期 | 动作 |
|---|---|
| 2026-09-28 | agent-a-apollocorp 初稿成文:三查(锁/唯一化/ps=5)→ 三源核验(arXiv abs+HTML v6 / HF API via hf-mirror / GitHub README;apollo.llmzoo.com 抓取失败存照)→ DB 查重 0 命中 → FACTS.md 九节 → 成稿分 9 part 拼接 → 双检自证 |
| 2026-09-28 | 核验员候选信息(3,741,196 行 / 22.3 GB / Apache-2.0 / 六语言 / arXiv:2403.03640)全部经一手复核;其中"六语言"按坑 2 细化为"预训练五语言 + SFT 六语言" |
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mediqa — 共享标签:医疗NLP / 临床文本 / 生物医学文献 / 评测基准
- ehrsql — 共享标签:医疗NLP / 临床文本 / 医学问答 / 评测基准
- xmedbench — 共享标签:医学问答 / 医学考试 / 评测基准
- cord-19 — 共享标签:医疗NLP / 生物医学文献 / 医学问答
- meddialog — 共享标签:医疗NLP / 临床文本 / 医学问答
- pubmedqa — 共享标签:医疗NLP / 生物医学文献 / 医学问答 / 评测基准
- medqa — 共享标签:医疗NLP / 医学问答 / 医学考试 / 评测基准
- medmcqa — 共享标签:医疗NLP / 医学问答 / 医学考试 / 评测基准
- cmb-cmexam — 共享标签:医疗NLP / 医学问答 / 医学考试 / 评测基准
- medcalc-bench — 共享标签:医疗NLP / 临床文本 / 医学问答 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

