ApolloCorpus (apollocorpus) — AI-Ready Wikipedia

深圳大学 FreedomIntelligence 团队发布的六语言(en/zh/es/fr/pt/hi)医疗 LLM 预训练+SFT 混合语料:374 万文档、预训练部分 2.5B tokens、首创 QA-Augmented Pre-training 与 Priority sampling,Apache-2.0 于 HuggingFace 公开

来源 九类医疗文本(Books/Papers/Encyclopedias/Dialogues/Exams/Guidelines/medicalWiki 多语言版)加通用文本(Web/General/Math/Code),叠加 ChatGPT 改写的 QA-Augmented 扩展与 11 个开源上游数据集发布时间: 2026-09-29最后更新: 2026-09-29 阅读 12
ApolloCorpus (apollocorpus) — AI-Ready Wikipedia

信息速览

数据集名称ApolloCorpus (apollocorpus) — AI-Ready Wikipedia
数据类型模型生成,文本数据,清洗数据
规模3,741,196 条文档(纯文本语料,无患者级数据)
接入方式九类医疗文本(Books/Papers/Encyclopedias/Dialogues/Exams/Guidelines/medicalWiki 多语言版)加通用文本(Web/General/Math/Code),叠加 ChatGPT 改写的 QA-Augmented 扩展与 11 个开源上游数据集
AI 就绪度

INFOBOX — ApolloCorpus 一屏速览

维度 内容
本质 面向"60 亿人口"的六语言医疗 LLM 预训练+SFT 混合语料:九类医疗文本+四类通用文本,叠加 QA-Augmented 扩展
团队 深圳大学 FreedomIntelligence 团队,通讯 Benyou Wang;论文 12 作者
论文 arXiv:2403.03640《Apollo: Lightweight Multilingual Medical LLMs toward Democratizing Medical AI to 6B Population》(v1 2024-03-06 → v6 2024-10-12)
数据 3,741,196 条文档;HF 口径 22.3GB(下载实测约 36.5GiB);预训练部分约 2.5B tokens(Tab.2 精确合计 2,536.3M)
构成 医疗六类 1,245.7M tokens(Books 413.8M/Papers 349.0M/Encyclopedias 226.2M/Dialogues 149.1M/Exams 78.0M/Guidelines 29.6M)+ 通用四类 1,290.6M(Web 886.7M/General 364.9M/Math 22.6M/Code 16.4M)
语言 医疗部分六语言(en/zh/es/fr/pt/hi);medicalWiki_hi 仅 209 行(极不均衡,坑 5)
方法 QA-Augmented Pre-training(ChatGPT 逐文档改写问答)+ Priority sampling(π(PT)=16/π(SFT)=2)
上游 PMC-Patients、HuatuoGPT、Huatuo_26M、MAQA、CMB、ShareGPT、Alpaca、WizardLM、belebele、ai2_arc、Capybara
模型家族 Apollo 0.5B/1.8B/2B/6B/7B(后续扩至 34B/72B)+ MedJamba(2024-04)+ ApolloMoE(2024-10)
核心结果 Apollo-7B 于 XMedBench 平均 58.78(基座 Gemma-7B 52.44,+6.34);同期 GPT-4 73.37、GPT-3.5 57.80
获取 HF load_dataset("FreedomIntelligence/ApolloCorpus") 公开直链;GitHub ApolloCorpus.zip / 0.download_data.sh
许可 Apache-2.0
库内互链 medmcqa(111)、headqa(120)、cmb-cmexam(180)、meddialog(210)、pmc-oa(320)、s2orc(370)

ApolloCorpus 是一个"把医疗大模型做成六国语言公共品"的数据工程:深圳大学 FreedomIntelligence 团队围绕"让医疗 AI 覆盖全球 60 亿人口"的目标,汇集书籍、论文、百科、对话、考试、指南九类医疗文本与网络、通用、数学、代码四类通用文本,共 3,741,196 条文档、约 2.5B tokens,并首创 QA-Augmented Pre-training——用 ChatGPT 把每篇文档改写成问答对、再按 Priority sampling 加权混入训练流,训练出 0.5B 到 72B 的 Apollo 模型家族。它是开源世界里少见的"数据+方法+模型+基准"四位一体医疗 LLM 工程,Apache-2.0 直链可取。

导语读法三则:

  1. 只想下数据:直奔 §7 获取与许可——HF load_dataset 一行可取,Apache-2.0 无请求制;注意 22.3GB 与 36.5GiB 双口径(坑 4)。
  2. 关心预训练方法:直奔 §4 QA-Augmented Pre-training 与 §3.3 Priority sampling——"每篇文档额外生成问答对再预训练"是本文方法论卖点。
  3. 做多语言医疗评测:直奔 §6 XMedBench 与 Apollo-7B 结果对照——六语言医疗考试基准与 GPT-4 的差距表可直接对标。

§0 导读:这个数据集解决什么问题

医疗大语言模型的能力上限,从来不只是模型架构问题,更是数据问题。2023 年前后,英文医疗 LLM(Med-PaLM、MedAlpaca、HuatuoGPT 等)快速迭代,但两个结构性缺口始终没有填补:一是语言缺口——绝大多数高质量医疗语料是英文,中文尚有 CMB/CMExam 一线资源,西班牙语、法语、葡萄牙语、印地语几乎荒芜,而这恰恰是全球人口最多的语言集合;二是方法缺口——预训练语料普遍"文档进、文档出",医疗知识以陈述式段落存在,与下游"患者问、医生答"的问答形态存在格式鸿沟。

ApolloCorpus(论文中称语料合集为 ApolloCorpora)对这两个缺口各给出一个回答。对语言缺口:它把医疗文本按英语、中文、西班牙语、法语、葡萄牙语、印地语六种语言系统收集——这六种语言的母语人口恰好约 60 亿,对应论文标题里的"to 6B Population"。对方法缺口:它提出 QA-Augmented Pre-training,让 ChatGPT 把每篇文档改写成若干问答对,把"陈述式知识"转译成"问答式知识",并配以 Priority sampling 策略(问答扩展的采样权重远高于原文),保证改写后的问答形式在训练流中占主导。

最终产物是三层资产:数据层是 3,741,196 条文档的 ApolloCorpus;模型层是从 0.5B 到 7B 的轻量级 Apollo 家族(后续扩展 34B/72B,并衍生 MedJamba、ApolloMoE 两个变体);基准层是覆盖六语言的 XMedBench 医学考试基准。Apollo-7B 在 XMedBench 上平均 58.78 分,比基座 Gemma-7B 的 52.44 高 6.34 分,且以约 1/10 的参数量在多语言医疗场景与 GPT-3.5(57.80)打平——"轻量模型+精心构型数据"路线的代表性证据。

§0 读法三则:

  1. 这个条目是"语料+方法+模型家族+基准"四合一:本体是 ApolloCorpus 语料,方法卖点是 QA-Augmented Pre-training,下游是 Apollo 模型家族,配套是 XMedBench——四者都 Apache-2.0 开放,但检索名各不相同(语料单数 ApolloCorpus、论文合集复数 ApolloCorpora,坑 1)。
  2. 全文统计数字均出自论文正文与表格、HF 数据卡与 GitHub README 的一手核验(核验时点 2026-09-28,经 hf-mirror.com API);已知漂移处(体积 22.3GB vs 36.5GiB、发布日期 02-12 vs 03-06、作者拼写等)已分别在坑 3、坑 4、坑 2 存照。
  3. "六语言"是医疗部分口径:通用文本(Web/General/Math/Code)基本为英文,medicalWiki_hi 仅 209 行——做多语言采样前务必读 §2.3 与坑 5。

§1 数据集速览:十问十答

Q1:ApolloCorpus 到底是什么、谁做的?
深圳大学 FreedomIntelligence 团队(通讯作者 Benyou Wang)发布的医疗大语言模型预训练+SFT 混合语料,共 3,741,196 条文档。它是 Apollo 系列工作(arXiv:2403.03640)的数据基座:同一个团队用这批语料训练了 0.5B-7B 的 Apollo 模型家族,并配套发布了 XMedBench 评测基准。HF 数据卡名叫 ApolloCorpus(单数),论文里把语料合集称作 ApolloCorpora(复数)——两个名字指同一批数据(坑 1)。

Q2:"六语言"具体指什么、覆盖多广?
英语、中文、西班牙语、法语、葡萄牙语、印地语六种,选择标准是母语人口合计约 60 亿。六语言覆盖主要体现在医疗文本部分:medicalWiki 等多语言子集按语言切分 split。但覆盖极不均衡——印地语切片 medicalWiki_hi 仅 209 行,而英文类目体量大得多;通用文本部分基本为英文(坑 5、坑 9)。

Q3:规模到底多大?
三个口径:行数 3,741,196 条文档(HF API 实测);体积 HF 数据卡写 22.3GB,下载文件夹实测约 36.5GiB(十进制/二进制与压缩态差异,坑 4);tokens 预训练部分约 2.5B(论文 Tab.2 十类精确合计 2,536.3M)。做管线规划时以 40GB 磁盘余量、2.5B tokens 为准。

Q4:语料由哪些类别构成、各占多少?
预训练部分十类(Tab.2):Web 886.7M tokens、Books 413.8M、General 364.9M、Papers 349.0M、Encyclopedias 226.2M、Dialogues 149.1M、Exams 78.0M、Guidelines 29.6M、Math 22.6M、Code 16.4M。其中医疗核心六类(Books/Papers/Encyclopedias/Dialogues/Exams/Guidelines)合计约 1,245.7M tokens,约占总量的 49%;其余为通用文本配比(详见 §2.1 与 §2.2 的全表)。

Q5:QA-Augmented Pre-training 是什么?
本工作首创的预训练增强方法:对语料中每篇文档,用 ChatGPT 生成若干"问答对"——把文档内容转译成患者/学生视角的提问与对应回答,形成该文档的 QA 扩展版本;预训练时原文档与 QA 扩展一起进入训练流。动机是弥合"陈述式文档"与"问答式使用场景"之间的格式鸿沟(详见 §4)。

Q6:Priority sampling 是什么?
QA 扩展与原文的配比策略:预训练数据中文档原文采样概率基数 1、其 QA 扩展权重 π(PT)=16;SFT 数据中 QA 权重 π(SFT)=2。也就是说,一篇文档被改写出的问答内容,在训练流中出现的频率是原文的 16 倍——这是"问答形式主导训练"的量化保障(详见 §3.3)。

Q7:上游数据从哪来?
两条线。医疗文本线:PubMed 文献、医学书籍、医学百科、医患对话(含 MedDialog 类资源)、医学考试题库、临床指南,以及 PMC-Patients、HuatuoGPT、Huatuo_26M、MAQA、CMB 等开源数据集。通用文本线:网页、通用语料、数学、代码,以及 ShareGPT、Alpaca、WizardLM、belebele、ai2_arc、Capybara 等开源混合集(详见 §3.1)。

Q8:用这批语料训练出的模型表现如何?
Apollo-7B(基座 Gemma-7B)在六语言医学考试基准 XMedBench 上平均 58.78,比基座的 52.44 高 6.34;同期 GPT-4 为 73.37、GPT-3.5 为 57.80——轻量级模型在多语言医疗场景追平 GPT-3.5。家族内 0.5B/1.8B/2B/6B/7B 各档相对各自基座均有提升(详见 §6.2)。

Q9:我现在能拿到什么、什么许可?
三条获取路径全部公开直链:HuggingFace load_dataset("FreedomIntelligence/ApolloCorpus");GitHub 仓库的 ApolloCorpus.zip;仓库内 0.download_data.sh 一键下载脚本。许可为 Apache-2.0,无请求制、无注册门槛(详见 §7)。

Q10:为什么它对 AI-Ready 重要?
它是医疗文本语料里"数据-方法-模型-基准"闭环最完整的开源样本:数据 Apache-2.0 直链即用(可及性满分档),QA-Augmented 方法给出了"文档→问答"的可复制管线,模型家族提供了可直接对比的基线,XMedBench 提供了六语言评测入口。对想构建非英文医疗 LLM 的团队,这是一份"从数据到评测"的完整参考实现(详见 §7.3 与 §8.3)。

§2 身份与团队:FreedomIntelligence 的多语言医疗版图

2.1 团队与机构

ApolloCorpus 出自 FreedomIntelligence(自由智能团队)——一个挂靠香港中文大学(深圳)(The Chinese University of Hong Kong, Shenzhen)与深圳大数据研究院(Shenzhen Research Institute of Big Data)的医疗 AI 研究组。团队在此前数年已构建了一条中文医疗 AI 数据流水线:CMB(中文医疗基准)、CMB-Exam、HuatuoGPT 系列的合作数据等;ApolloCorpus 是该团队从中文/双语走向"六语言全球化"叙事的转折点,也是其第一次把预训练级语料整体开源。

论文署名 12 人(arXiv abs v6 一手):Xidong Wang、Nuo Chen、Junying Chen 三人为共同一作(论文页脚声明前三作者同等贡献,且注明 Benyou Wang 为通讯作者,wangbenyou@cuhk.edu.cn),其后依次为 Yidong Wang、Guorui Zhen、Chunxian Zhang、Xiangbo Wu、Yan Hu、Anningzhe Gao、Xiang Wan、Haizhou Li、Benyou Wang。注意两个署名细节:第一作者 Xidong Wang 同时是论文提交者;作者名 Junying Chen 在 arXiv abs 页拼作 “Junyin Chen”,HTML 正文拼作 “Junying Chen”——后者与团队其他项目署名一致(坑 6)。

团队后续的演化路线在 GitHub 时间线上清晰可见:2024.04.25 发布 MedJamba(把医疗配方嫁接到 Jamba 架构),2024.10.15 发布 ApolloMoE(混合专家版,宣称覆盖 50 种语言)——ApolloCorpus 的"六语言"版图在一年内扩张了近十倍语言数,但那个 50 语言的后续工作没有再以同等深度开源预训练语料,ApolloCorpus 至今仍是团队最完整的一次数据公开。

2.2 论文与版本时间线

日期 事件 依据
2024-01-23 Apollo GitHub repo 发布 README 时间线
2024-02-12 ApolloCorpus 与 XMedBench 发布(README 口径) README 时间线(HF repo createdAt 实为 2024-03-06,坑 7)
2024-03-06 11:56 UTC arXiv:2403.03640 v1 提交(14,155 KB) arXiv 提交史
2024-03-06 13:03 UTC HF 数据集 repo 创建 HF API createdAt
2024-03-07 README 记 “Paper released” README 时间线
2024-03-09 / 06-28 / 08-16 / 09-14 arXiv v2/v3/v4/v5 arXiv 提交史
2024-04-25 MedJamba 发布 README 时间线
2024-09-13 HF 数据集最后一次修改 HF API lastModified
2024-10-12 arXiv v6(当前版,标题定稿 “A Lightweight”) arXiv 提交史
2024-10-15 ApolloMoE repo 发布(50 语言) README 时间线

论文标题本身有一段小进化史:v1/v4 HTML 时期写作 “An Lightweight…”(语法瑕疵),v6 定稿为 “A Lightweight…”,而团队自己 README 里的 BibTeX 建议条目干脆写成 “Lightweight…”(无冠词)——三个口径并存,引用时以 arXiv abs 页当前版为准(坑 6)。论文状态截至抓取(2026-09-28)仍标注 Preprint,未检索到期刊正式发表版(待核 T2)。

2.3 命名:Apollo 与 “6B People”

模型名 Apollo 取自希腊神话中司掌医药、瘟疫、太阳与光明的神祇——论文原话解释为"symbolizes the democratization of medical LLMs to 6 billion people, illuminating global healthcare"。标题中的 “6B People” 指六种语言的母语/使用人口合计约 61 亿(论文脚注:按 Wikipedia 语言人口列表与国家人口列表口径,覆盖 132 个国家和地区)——注意这是"语言覆盖人口"而非"模型参数 6B",6B 恰好又是 Apollo 模型系中的一个规模档(Apollo-6B),检索时极易混淆。

§3 数据本体:行数、字节数与 token 账本

3.1 三套规模口径,一次说清

ApolloCorpus 的"大小"有三个常被混用的数字,先对齐口径:

口径 数值 来源 何时用
行数 3,741,196 rows HF 页面快照(pretrain_text config,13 splits) 引用"多少条记录"时
文件大小 22.3 GB HF 页面 Total file size 引用"下载多大"时
存储占用 39,147,380,685 B ≈ 36.5 GiB HF API usedStorage 核算 HF 仓库真实占用(含 zip 整包与 LFS 全部文件,与页面口径不同,坑 3)
token 量 2.5B tokens(Tab.2 分项合计 2,536.3M) 论文一手 引用"多少训练 token"时

补充元数据(HF API 一手,抓取时点 2026-09-28):downloads 1,242(API 实时;页面快照另一时点 1,529)、likes 41、size_categories 1M<n<10M、format json、modality text、license tag apache-2.0、关联论文 tag arxiv:2403.03640、gated false、private false。引用数背景:Google Scholar 显示被引 71(2026-09-28 快照),arxiv.gg 显示 Cited by 19(不同口径)——引用数不作为本条目硬数字。

3.2 论文 Tab.2:token 账本(一手表格原样转录)

这是全数据集最有信息量的一张表——每一类数据在每种语言里的 token 配比,精确到 0.1M:

数据源 训练阶段 语言(token) 合计
Web(网络医疗内容,专业外入口) Continue Pretrain EN 499.9M, ZH 329.3M, ES 57.5M 886.7M
Books(医疗书籍) Continue Pretrain EN 296.7M, ZH 117.1M 413.8M
General(通用指令) Instruction Tuning EN 194.5M, ZH 69.4M, HI 43.9M, FR 20.0M, AR 18.7M, ES 18.4M 364.9M
Papers(医学论文) Continue Pretrain EN 252.9M, ZH 45.6M, ES 46.0M, FR 4.5M 349.0M
Encyclopedias(医学百科) Continue Pre-train EN 221.1M, FR 4.6M, HI 0.5M 226.2M
Dialogues(医患对话) Continue Pretrain EN 92.1M, ZH 46.6M, AR 10.4M 149.1M
Exams(医学考试) Instruction Tuning EN 42.1M, ZH 35.3M, ES 0.5M, FR 0.1M 78.0M
Guidelines(临床指南) Continue Pretrain EN 29.6M 29.6M
Math(数学指令) Instruction Tuning EN 18.9M, ZH 3.7M 22.6M
Code(代码指令) Instruction Tuning EN 9.2M, ZH 7.2M 16.4M
合计 ≈2,536.3M ≈ 2.5B

从这张表能读出四个结构性事实:

  1. Web 是最大单项(886.7M,占 35%)。作者刻意混入"专业外"网络医疗内容,理由是模拟医学生"核心课程之外的信息摄取",保持对互联网语体的适应力——代价是这部分内容质量最不可控(§8 使用注意)。
  2. 印地语与阿拉伯语在预训练侧近乎缺席:Encyclopedias-HI 仅 0.5M,Dialogues-AR 10.4M(且未随 HF 发布,见坑 2);两语言的真实支撑主要在 SFT 的 general 分片(HI 43.9M / AR 18.7M)。
  3. Instruction Tuning 合计 481.9M token(Exams 78.0 + General 364.9 + Math 22.6 + Code 16.4),占总量约 19%——这不是一个纯预训练语料,而是一份"预训练:指令 ≈ 4.3:1"的混合配方,与其 Mix Training 训练法互为表里。
  4. 语言配比高度不均:EN 全表合计 1,657.0M(65.3%),ZH 654.2M(25.8%),ES 122.4M(4.8%),HI 44.4M(1.8%),FR 29.2M(1.2%),AR 29.1M(1.1%)。所谓"六语言覆盖 61 亿人",落到 token 上是两个数量级的落差——使用时不应期待均衡的多语言覆盖(逐语言对账卡见附录 R)。

3.3 HF 发布结构:文件级清单(API siblings 一手)

HF 仓库发布两种取用形态:散文件(train/ 目录,与 datasets 库 config 对接)与整包(根目录 ApolloCorpus.zip,与论文复现脚本对接)。

预训练部分(config 名 pretrain_text,13 splits,viewer 行数口径):

split 行数 split 行数
medicalPaper_en 878k medicalGuideline_en 99.7k
medicalWeb_zh 641k medicalPaper_es 89k
medicalWeb_en 394k medicalWiki_fr 8.39k
medicalBook_en 553k medicalPaper_fr 8.28k
medicalBook_zh 500k medicalWiki_hi 209
medicalWiki_en 239k medicalWeb_es 153k
medicalPaper_zh 177k

每个数据源-语言组合在仓库里成对发布 _text.json(字符串列表)与 _qa.json(问答对嵌套列表)两个文件,例如 train/pretrain/medicalBook_en_text.json 与 train/pretrain/medicalBook_en_qa.json。注意 viewer 的 13 splits 只统计 _text 文件(config 只挂载 text),_qa 文件需另行取用——所以"3,741,196 行"只是预训练文本侧的口径,不含 qa 副本(坑 3)。

SFT 部分(无统一 config,散文件直取):code_en/code_zh、general_ar/general_en/general_es/general_fr/general_hi/general_zh、math_en/math_zh、medicalExam_en/medicalExam_es/medicalExam_fr/medicalExam_zh(另有 _clean/_dup/_dup_question 三个变体后缀文件,用于去重流程,见待核 T4)、medicalPatient_ar/medicalPatient_en/medicalPatient_zh。

把 HF 文件矩阵与论文 Tab.2 并排看,有一处结构性缺口:论文 Dialogues-AR 10.4M 继续预训练 token 在 HF 的 pretrain 目录找不到对应文件(pretrain 五语言 en/zh/es/fr/hi 不含 ar);阿拉伯语的实际发布落点是 SFT 的 general_ar.json 与 medicalPatient_ar.json。论文叙事(六语言全阶段覆盖)与发布实物(预训练五语言)之间的这段落差,是使用本语料做六语言预训练时最需要预知的现实(坑 2)。

3.4 数据格式样例

预训练 text 侧(list of string):

[
  "string1",
  "string2"
]

预训练 qa 侧与全部 SFT(问答对嵌套列表,平铺 q1,a1,q2,a2):

[
  ["q1", "a1", "q2", "a2"]
]

viewer 实拍(medicalWeb_zh 分片,p=312):一条中文网络医疗问答文本,讨论癌症晚期患者食欲不振的机制(5-羟色胺受体、NK-1 受体、化疗与阿片类药物副作用、促胃肠动力药等),字符串长度分布 32 至 34.7k 字符——可直观感受 medicalWeb 分片的"论坛体"质地:医学正确性与口语化并存。

§4 数据来源与处理:一条可复制的多语言医疗配方

4.1 数据从哪来(逐类逐语言溯源)

论文 §3.1 与附录 A 记录了每种数据的来源与清洗方式。与医生和医学生"充分沟通"(extensive communication)后,作者先锁定六类高质量医疗数据源,再补入网络内容与通用能力数据。逐类溯源如下:

类别 语言 来源(论文一手)
医患对话 Dialogues EN 基于 PMC-Patients(Zhao et al. 2022)用 ChatGPT 构造多轮医患对话,论文 Fig.5 给出改写 prompt 模板(要求患者问题与医生回答"尽可能复杂详尽")
医患对话 Dialogues ZH 直接采用 HuatuoGPT 数据集(Zhang et al. 2023)与 Huatuo_26M(Li et al. 2023b)的简化子集——团队自家前作资产复用
医患对话 Dialogues AR 从最大的阿拉伯医疗问答数据集 MAQA(Abdelhay and Mohammed 2022)抽取问答长度均 >128 的高质量对
医学百科 Encyclopedias EN 医学维基类文本,用 English Medical Dictionary 过滤出 36,107 个医学相关词条
医学百科 Encyclopedias FR/HI 同类百科来源(HI 仅 0.5M token,209 行)
医学论文 Papers EN/ZH/ES/FR 生物医学论文文献(EN 252.9M 为最大论文分片;与 PMC 系语料同域,可对照库内 pmc-oa(320)、s2orc(370))
医学书籍 Books EN/ZH 医学教材与专著(EN 296.7M / ZH 117.1M)
临床指南 Guidelines EN 临床实践指南(仅英文 29.6M——低资源语言几乎没有可用的开放指南语料)
医学考试 Exams EN/ZH/ES/FR ZH 收集 CMB(Wang et al.)训练集等;EN 对应 USMLE 系考试题;ES/FR 少量(0.5M/0.1M)
Web EN/ZH/ES 在线医疗论坛与问答(论文注明 “medicalWeb (from online forum)”)
General 六语言 ShareGPT、Alpaca 原始数据;ZH 另加 GPT-4 按 WizardLM 方法(Xu et al. 2023)生成的数据;EN 另加 WizardLM、belebele(Bandarkar et al. 2023,多语言阅读理解)、ai2_arc(Clark et al. 2018,抽象推理)、Capybara(Daniele and Suphavadeeprasits 2023,指令遵循)
Math / Code EN/ZH 数学推理与代码指令(保持通用推理/编程能力,防止领域微调"变笨")

值得注意的诚实细节:阿拉伯语对话数据的门槛是"问答长度均 >128 字符"——在极低资源场景下,作者选择"宁少勿短"的抽取策略;而印地语百科 0.5M token(HF 仅 209 行)则坦率暴露了印地语医学百科语料的匮乏程度。这两个数字放在一起,比任何叙述都更直观地呈现了"医疗 AI 民主化"的数据现实。

4.2 QA-Augmented Pre-training:为什么预训练数据长着一张问答脸

继续预训练(continued pre-training)领域有一个公认痛点:模型在"读书"(适应域内文本分布)的过程中会遗忘"答题"(指令遵循)能力,域适应与对齐两阶段互相拆台。ApolloCorpus 的应对是在数据侧而非训练侧解决:用 ChatGPT 把预训练文本批量改写成医患问答对,让"读书"的过程本身就携带问答格式。

论文的消融实验(Tab.4,Qwen-1.8B backbone)支持了这一设计:

设置 六语言平均
基座 Qwen-1.8B 25.84(单语口径)/ 28.99(混合口径)
重写为 QA(分离训练 ParaData-Sep) 38.16
直接用 QA(分离训练 QAData-Sep) 38.53
ParaData-Mix(平滑过渡) 35.40
QAData-Mix(Apollo 配方) 38.53(混合口径 44.74 见主表)

结论:改写为 QA 相对直接续训"整体无损",部分语言(英/印地)略有波动但其他语言提升,配合 Mix Training 平滑过渡后在主表拿到 44.74 的平均分(较基座 28.99 提升 15.75 分)。HF 上每个预训练分片都带 _qa 副本文件,就是这条流水线的固化产物。

4.3 Mix Training 与 Priority Sampling:两个阶段的平滑焊接

训练数据 D = D_PT(继续预训练)∪ D_SFT(指令微调)。朴素做法是先吃 D_PT 再吃 D_SFT,阶段切换处分布突变。ApolloCorpus 的配套训练法是 priority sampling:每条数据 x 在第 t 步的采样概率按 π(x) 加权归一(P_t(x) = π(x) / Σ π(y),已采过的集合 S_t 被扣除),论文设定 π=16(预训练数据)、π=2(指令数据),即预训练数据的采样权重是指令数据的 8 倍,同时保持"先预训练后指令"的全局序列——切换被摊平成缓坡而非断崖。训练超参:batch size 256、学习率 1e-5。

这一节的意义在于:ApolloCorpus 发布的不只是数据,还有数据的使用方式——论文把采样配比、阶段顺序、超参全部写明,配方可复制性在同类语料发布中属于高水准。

4.4 数据泄漏检查与质量控制

论文 §3.1 设有专节 “Data Leakage Checking”(确保评测集不混入训练语料);附录 A.1 专门交代分类学与采集细节、A.2 交代改写细节。需要指出:与库内影像类数据集常见的"逐例标注协议"不同,本语料的质量控制重心在来源筛选(词典过滤、长度过滤、考试题库)与改写一致性(ChatGPT prompt 模板统一),没有人工逐条抽检的量化报告——审计深度弱于标注型数据集,使用者应把 Web 分片视为"需二次清洗"的原料(§8)。

§5 获取与许可:三条路,零门槛

5.1 License

数据集 license 为 Apache-2.0——HF API cardData.license 与 tags 双重确认(一手),这也是 22.3 GB 级医疗预训练语料里相当宽松的许可:允许商用、允许修改再分发、要求保留许可声明与 NOTICE。对比参照:Meditron 依赖的语料许可各异、PMC 系语料常受 PubMed 版权约束、部分中文医疗数据集限研究用途——ApolloCorpus 的 Apache-2.0 使其成为六语言医疗预训练里"许可最省心"的一档。

边界说明:Apache-2.0 覆盖的是发布物(JSON 文件的组织与再分发),不等于其中每一条底层文本的原生版权(书籍/论文/考试题在其原地的版权状态各有归属)——学术与商用前对具体分片的合规审查仍不可豁免,尤其 Books/Papers 分片(§8 坑 5)。

5.2 三条获取路径

  1. HF datasets 直载(推荐给训练管线):load_dataset("FreedomIntelligence/ApolloCorpus", "pretrain_text") 获得 13 个预训练 text splits;SFT 散文件经 data_files 参数手动挂载。
  2. 整包 zip:仓库根目录 ApolloCorpus.zip(约 22.3 GB),内含论文复现所需的完整目录结构(pretrain + sft)。
  3. GitHub 脚本:FreedomIntelligence/Apollo 仓库的 0.download_data.sh——论文复现流水线的第一步,自动拉取数据并按模型整理。

工程提示:HF 主站在部分网络环境不可直连,可走镜像站(把 huggingface.co 换成 hf-mirror.com,API 与 resolve 路径同构);整包 zip 适合一次性归档,散文件适合按语言/类型增量取用(例如只要六语言 SFT 时不必拉 22.3 GB)。

5.3 配套发布的另外两件套

  • XMedBench(HF FreedomIntelligence/XMedbench):六语言医疗多选基准(§6 详述),与语料同 license 体系发布。
  • Apollo 模型权重:0.5B/1.8B/2B/6B/7B(论文五款)+ 34B/72B(GitHub 列出)+ MedJamba + 四款 GGUF 量化版(0.5B/2B/6B/7B,mradermacher 协助)。

5.4 版本状态

HF 数据集 repo 自 2024-09-13 后未再修改(lastModified 一手),无 v2/修订版;arXiv 论文最新 v6(2024-10-12)。换言之,这是一个已冻结的发布:内容不会漂移,引用时注明抓取时点即可复现。发布日期口径注意:GitHub README 写 “2024.02.12 published”,而 HF repo createdAt 为 2024-03-06(坑 7)。

§6 XMedBench 与 Apollo 模型:语料的成绩单

6.1 XMedBench:六语言医疗多选基准

XMedBench 是与语料配套发布的评测集,设计逻辑是"每语言至少一个本源基准,缺就翻译补齐":

语言 组件 说明
EN MedQA-USMLE、MedMCQA、MMLU-Medical(Clinical knowledge / Medical genetics / Anatomy / Professional medicine / College biology / College medicine) 全部本源;PubMedQA 因结果波动过大被排除出论文
ZH MedQA-MCMLE、CMMLU-Medical(Anatomy / Clinical_knowledge / College_medicine / Genetics / Nutrition / Traditional_chinese_medicine / Virology) CMB-single(随机 2,000 单选)与 CExam(随机 2,000)未入论文
ES HeadQA 西班牙语本源医学考试基准
FR FrenchMedMCQA 法语本源
HI MMLU_HI(Clinical knowledge 等六个医学子集) 印地语无本源基准——MMLU 医学子集翻译版,经专业医师校验
AR MMLU_Ara(同上六子集) 阿拉伯语同法处理

评估协议:3-shot、正则抽取选项、生成长度上限 128/下限 2 tokens、0.5B 全精度加载其余半精度。

一个检索级警告:GitHub README 的 XMedBench 清单里,HI 行的链接实际指向 MMLU_Arabic、AR 行的链接实际指向 MMLU_Hindi——两行链接互换(坑 4)。以论文正文与本表为准。

6.2 基座-Apollo 配对表:领域语料值多少分

论文 Tab.3(“Our Models and their Bases” 区块)把每个 Apollo 与其基座并排放置——这张表实质上是"吃下 ApolloCorpus 能涨多少分"的量化答案:

基座 基座 avg Apollo Apollo avg 增幅
Qwen-0.5B 19.17 Apollo-0.5B 37.47 +18.30
Qwen-1.8B 28.99 Apollo-1.8B 44.74 +15.75
Gemma-2B 28.74 Apollo-2B 39.94 +11.20
Yi-6B 46.65 Apollo-6B 57.54 +10.89
Gemma-7B 52.44 Apollo-7B 58.78 +6.34

两个可直接迁移的结论:其一,基座越弱、语料增益越大(0.5B 档涨 18.3 分 vs 7B 档涨 6.3 分)——领域语料对小模型的边际价值远大于大模型;其二,基座横跨 Qwen×2、Gemma×2、Yi×1,说明配方对基座家族不敏感。第三方转述常把 Apollo 说成"基于 Qwen 架构"——那只对 0.5B/1.8B 成立,7B 的基座是 Gemma-7B(坑 7)。

6.3 同场对比:Apollo-7B 在 2024 年的位置

XMedBench 上 Apollo-7B(58.78)与同期代表模型:

梯队 模型 avg
闭源 GPT-4 73.37
闭源 GPT-3.5 57.80
开源 >70B Qwen-72B 68.74
开源 >70B Meditron-70B 47.60
开源 >70B Llama-2-70B 36.63
开源 7-14B Qwen-14B 52.67
开源 7B 级 Gemma-7B 52.44
开源 7B 级 MMedLM2-7B 51.45
开源 7B 级 Mistral-7B 43.16
开源 7B 级 Qwen-7B 40.01
开源 7B 级 BioMistral-7B 38.08
开源 7B 级 Huatuo2-7B 36.72
本条目 Apollo-7B 58.78

Apollo-7B 以 7B 体量压过全部 ≤70B 开源对手并小幅超过 GPT-3.5(58.78 vs 57.80)——这是论文"lite 模型民主化"叙事的实证支点。附带发现(论文 §4.3):多语言混合训练优于单语言训练(pilot study 中混合训练六语言平均全面高于任一单语模型),医疗知识被论证为"相当程度上语言中立",跨语言训练产生协同增益——这为低资源语言"搭便车"高资源语言提供了数据层面的论据。

6.4 Proxy-Tuning:小模型语料的第三种用法

论文 §5 展示了 lite Apollo 的另一用途:proxy-tuning——不改动大模型权重,用"微调前后的小模型对"(M_tuned − M_raw)的 logit 偏移量在推理时修正大模型 M_base:output = M_base + (M_tuned − M_raw)。即用 Apollo-1.8B(及其 Qwen-1.8B 原基座)的差值作为"医疗化算子"叠加到更大模型上。第三方转述口径:对 Qwen-7B 平均提升约 3 分。对数据使用者的含义是:这份语料训练出的任意规模模型,都可以作为"领域修正器"资产化,而不只充当独立部署的端到端模型。

§7 生态:上下游与库内互链

7.1 数据流上游(被并入本语料的公开资产)

PMC-Patients(EN 对话改写源)、HuatuoGPT 与 Huatuo_26M(ZH 对话源)、MAQA(AR 对话源)、CMB(ZH 考试源)、ShareGPT / Alpaca / WizardLM / belebele / ai2_arc / Capybara(通用指令源)。这份上游清单本身就是一份"2024 年初多语言医疗/通用指令数据"的选型地图:想在别的语种复刻 Apollo 配方,逐项替换对应语言的等价物即可起步。

7.2 数据流下游(消费本语料的作品)

Apollo 0.5B/1.8B/2B/6B/7B/34B/72B 模型系、MedJamba(2024-04)、ApolloMoE(2024-10,宣称 50 语言)、四款 GGUF 量化部署版,以及 proxy-tuning 范式下的各类"借力"应用。论文引文网络显示后续工作包括 BioMistral(多语言评测视角)、BiMediX(双语)、MMedLM/MMedLM2、Medical mT5、Aqulia-Med 等——ApolloCorpus 与 XMedBench 成为多语言医疗 LLM 论文的标准对照物之一。

7.3 库内互链点(rid 已核,2026-09-28)

库内条目 rid 互链逻辑
medmcqa 111 XMedBench-EN 评测组件之一(印度医学考试题),同属"考试题驱动医疗 LLM"路线
headqa 120 XMedBench-ES 评测组件(西班牙语医学考试),ApolloCorpus Exams-ES 的同域参照
cmb-cmexam 180 XMedBench-ZH 评测同源(CMB 训练集直接并入本语料 Exams-ZH;cmexam 亦被列入未用组件)
pmc-oa 320 PMC 文献语料——medicalPaper-EN(252.9M token)的同域大规模对照
s2orc 370 生物医学文献大规模语料——论文侧来源的量级参照系
meddialog 210 医患对话语料——Dialogues 分片(EN/ZH/AR 共 149.1M token)的同类对照

另建议反向互链:panda-plus(640) 等金标准条目如涉及"AI-Ready 光谱"讨论,可将 ApolloCorpus 作为"文本语料类 Apache-2.0 全开放"端点引用。

§8 使用注意事项:八个坑,逐个排雷

以下八条是检索、引用与使用本语料时最容易踩的坑,编号连续,均为一手核验所得(核验时点 2026-09-28)。每条给出"现象—影响—建议"三段式。

坑 1:单复数双写法——ApolloCorpus 还是 ApolloCorpora?

现象:HF 数据集名叫 ApolloCorpus(单数),论文摘要与正文叫 ApolloCorpora(复数),GitHub README 两种写法混用。论文自身也不统一:摘要写 “the ApolloCorpora multilingual medical dataset”,致谢部分写 “training corpora”。

影响:文献检索时用单数会漏掉论文正文语境下的讨论,用复数会漏掉 HF 与模型卡语境下的讨论;引用复核时容易误判为两个东西。

建议:把它们当作同一语料的两个拼写变体。条目/论文引用用论文口径 ApolloCorpora,数据工程语境用 HF 口径 ApolloCorpus;首现处标注双写法即可,不必强行统一。

坑 2:宣传六语言,预训练实物只有五语言

现象:论文摘要、标题、HF 数据卡全部主打 “six languages / 六语言”;但 HF 发布的预训练文件矩阵(medicalBook/medicalGuideline/medicalPaper/medicalWeb/medicalWiki × 语言)里只有 en/zh/es/fr/hi 五种语言——没有任何 ar 预训练分片。阿拉伯语只在 SFT 出现:general_ar.json 与 medicalPatient_ar.json。论文 Tab.2 声称 Dialogues 含 AR 10.4M 继续预训练 token,但 HF 上找不到对应文件。

影响:按"六语言预训练语料"的预期做六语言继续预训练,阿语侧会拿到比预期少得多的数据(仅 18.7M general + medicalPatient 指令数据,无原始文本分片);与"覆盖 61 亿人口"的宣传存在心理落差。

建议:以 HF 发布实物为准规划数据配比;若必须阿语预训练文本,需自行引入 MAQA 原始数据或其他阿语医疗语料补充,并在论文引用时如实区分"论文叙述构成"与"HF 发布构成"。

坑 3:三个"大小"数字各有所指

现象:22.3 GB(HF 页面 Total file size)、39,147,380,685 B ≈ 36.5 GiB(HF API usedStorage)、3,741,196 rows(HF viewer)三个数字常被混用。行数口径只覆盖 pretrain_text config 的 13 个 _text splits——不含 _qa 副本、不含全部 SFT 散文件;usedStorage 则把 zip 整包与全部 LFS 历史都算进去。

影响:把 3,741,196 当"全部数据条数"会低估;把 36.5 GiB 当"下载体积"会高估磁盘需求。

建议:引用行数注明"pretrain_text 13 splits 口径";引用体积用 22.3 GB 并注明"页面口径";需要精确磁盘预算时以 zip 整包实测为准。

坑 4:GitHub README 的 HI/AR 基准链接互换

现象:GitHub README 的 XMedBench 清单里,HI(印地语)条目的链接实际指向 MMLU_Arabic 数据集,AR(阿拉伯语)条目的链接实际指向 MMLU_Hindi 数据集——两行链接互相错位。

影响:顺着 README 链接下载评测数据,印地语评测会拿到阿拉伯语题集,反之亦然;跑分后与论文完全对不上。

建议:以论文正文语言-基准对应关系为准(HI→MMLU_HI、AR→MMLU_Ara);下载后用样本语言肉眼抽检一遍。

坑 5:Apache-2.0 是发布许可,不是底层文本的版权豁免

现象:数据集以 Apache-2.0 发布(HF API 一手确认),但其中 Books(413.8M token)、Papers(349.0M token)、Guidelines(29.6M token)分片的底层文本来自受版权保护的出版物、论文与指南;Exams 分片来自考试题库(CMB 等,其原生许可各异);Web 分片来自在线论坛。

影响:把"Apache-2.0"理解为"其中所有内容可无顾忌商用"是过度引申;不同司法辖区对 TDM(文本与数据挖掘)例外条款的宽严差异很大。

建议:学术与内部评测用途风险最低;对外分发衍生产品(尤其是复述书籍内容的模型)前,按分片逐类评估底层版权与属地 TDM 例外;商用产品优先依赖 SFT/general 类由模型生成的分片。

坑 6:作者名与署名数的三个口径

现象:① 名字拼写:arXiv abs 页 “Junyin Chen” vs 论文 HTML 正文 “Junying Chen”(团队其他项目惯用后者);② 署名数:abs 页 12 人 vs README 建议 BibTeX 10 人(少了 Guorui Zhen 与 Chunxian Zhang);③ 标题冠词:abs 页 “A Lightweight”(v6 定稿)vs v4 HTML “An Lightweight” vs BibTeX “Lightweight”(无冠词)。

影响:引用条目与论文页不一致,审稿/复核时容易被判为引用错误。

建议:以 arXiv abs v6 页面为引用权威(12 作者、“Junyin Chen” 按其页——如需与团队其他工作一致性优先则注 Junying 并加注);标题用 “A Lightweight”;引用条目如用 README BibTeX,知悉其比 abs 页少两人。

坑 7:基座传闻——"Qwen backbone"只对了一半

现象:多个第三方转述(含英文技术博客)把 Apollo 系列概括为 “using the Qwen architecture as a backbone”。论文 Tab.3 一手表格显示五个基座:Qwen-0.5B、Qwen-1.8B、Gemma-2B、Yi-6B、Gemma-7B——七个规模里只有两个是 Qwen。

影响:按"Qwen 系微调"预期选择推理栈/tokenizer 会在 2B/6B/7B 三个规模上出错(Gemma 与 Yi 的 tokenizer、特殊 token、许可条款都不同);引用"Qwen 架构"会让领域综述失真。

建议:一切以论文 Tab.3 配对表为准;部署时逐规模核对 HF 模型卡的架构与 tokenizer 说明(GGUF 页标注的 llama 架构是 llama.cpp 的类别标签,不等于原基座)。

坑 8:34B/72B 的对话模板与 0.5B-7B 不同

现象:GitHub README 明确两套 usage format:0.5B/1.8B/2B/6B/7B 用 User:{query}\nAssistant:{response}<|endoftext|>;34B/72B 用 <|User|>:{query}\n<|Assistant|>:{response}<|endoftext|>。

影响:把 7B 的模板套到 34B/72B(或反之),推理质量会显著劣化;自动化评测脚本若写死一种模板会静默出错。

建议:按规模档分别配置模板;评测复现时先用模型卡的 few-shot 样例验证模板生效(论文评估协议为 3-shot)。

使用注意事项小结表

坑 一句话版本 优先级
1 ApolloCorpus/ApolloCorpora 是同一语料 引用时
2 预训练无阿拉伯语,ar 仅 SFT 建模前
3 行数/页面体积/API 占用三口径 引用时
4 README 的 HI/AR 评测链接互换 评测前
5 Apache-2.0 ≠ 底层文本版权豁免 商用前
6 作者拼写/署名数/标题冠词三口径 引用时
7 基座是 Qwen+Gemma+Yi 混合,非全 Qwen 部署前
8 34B/72B 对话模板另有一套 部署前

§9 方法论读评:这份语料做对了什么、没做什么

9.1 做对的四件事

  1. token 账本公开到 0.1M:论文 Tab.2 把每类每语言的 token 配比写透,配合训练超参与采样公式(π=16/2),配方可复制性在同类发布里属第一梯队。多数多语言医疗语料只给总量不给配比,导致后续工作无法做受控对照。
  2. 在数据侧解决预训练-对齐冲突:QA-Augmented Pre-training 把"改写"固化为发布物的一部分(_qa 文件与 _text 并行),后人不必重跑改写流水线即可复用两种视图——这是"数据集即方法"的设计,也是本条目把它列为 AI-Ready 关键特征的原因。
  3. 基座多样性验证:五个规模横跨三个基座家族,等于附带做了一组"配方跨基座稳健性"实验,结论(基座越弱增益越大)可直接迁移。
  4. 许可一步到位:Apache-2.0 + 无 gated + zip/散文件/API 三通道,取用摩擦接近于零——在医疗语料里是稀缺体验。

9.2 没做的三件事(使用者的对价)

  1. 无逐类质量审计报告:没有人工抽检准确率、没有 Web 分片毒性/错误信息比例、没有去重前后统计(仅从文件名可推断 medicalExam 有 dedup 流程)。使用者拿到的是"清洗过但未审计"的语料。
  2. 低资源语言止步于"有":HI 预训练百科 209 行、AR 预训练缺失——"民主化"叙事在数据实物层面兑现度有限,更像一次诚实的现状披露(印地语医学百科就这么多)。
  3. 生成式改写未标注单据:_qa 文件与 general 分片由 ChatGPT/GPT-4 生成或改写,但 HF 卡与论文均未提供逐条"生成来源"标记,无法把"自然采集文本"与"模型生成文本"在行级区分——做数据配比研究时需要自行推断。

9.3 一句话定位

ApolloCorpus 是"方法论文驱动的语料发布":它最大的价值不在数据量(2.5B tokens 在 2024 年属中型),而在它公开了一整套"多语言医疗 LLM 应该怎么喂"的可复制配方,并用 Apollo 模型系与 XMedBench 为配方提供了端到端验证。把它当作配方样本+许可友好的六语言医疗原料库,比当作"最大医疗语料"来用,更能发挥其价值。

§10 二次利用指南:四种打开方式

10.1 用法一:继续预训练(语料的设计主用途)

按论文配方,继续预训练的推荐姿势:

  1. 数据配比:以预训练侧约 2.0B token 为基(Web 886.7 + Books 413.8 + Papers 349.0 + Encyclopedias 226.2 + Dialogues 149.1 + Guidelines 29.6),叠加指令侧约 0.5B token(General 364.9 + Exams 78.0 + Math 22.6 + Code 16.4),比例约 4:1。
  2. text 与 qa 并用:每个分片取 _text 与 _qa 双视图;如按论文消融,QA 视图对最终成绩无损且保指令能力,可将 qa 权重适当调高。
  3. 采样策略:若自训框架支持动态采样,按 priority sampling(π_PT=16、π_SFT=2)平滑过渡;若只支持静态混合,直接按 token 比例混合亦可近似。
  4. 基座选择:多语言能力优先选 Qwen 系(论文 pilot study 选 Qwen-1.8B 正因其多语言支持);若目标是欧洲语言对(ES/FR),Gemma 系亦有一手验证(Apollo-2B/7B)。
  5. 超参起点:batch size 256、lr 1e-5(论文设定,7B 级以下验证有效)。

10.2 用法二:SFT/领域指令微调

只取 train/sft/ 目录即可开展:五类指令数据(code/general/math/medicalExam/medicalPatient)× 六语言。实用建议:

  • 医疗考试向:medicalExam(en/es/fr/zh)+ 医学问答对——与库内 medmcqa(111)、headqa(120)、cmb-cmexam(180) 等原生考试数据集组合时,注意 CMB 训练集已被并入本语料,联合训练需去重(坑 9 补注:变体文件 _dup/_clean 即团队去重流程的痕迹)。
  • 医患对话向:medicalPatient(ar/en/zh)+ meddialog(210) 同类组合,注意 EN 对话系 ChatGPT 从 PMC-Patients 改写生成,风格偏"教科书式问诊"。
  • 通用能力保底:general 分片在六语言间最均衡(18.7M-194.5M token),是多语言指令对齐的现成材料。

10.3 用法三:RAG 语料库

_text 分片(尤其 Books/Encyclopedias/Guidelines/Papers 四类)适合切块入库做检索增强:内容相对结构化、长度分布已知(medicalWeb_zh 实测 32-34.7k 字符/条)。注意事项:Web 分片论坛体噪声大,建议 RAG 库排除或降权;Guidelines 仅英文(29.6M token),非英文指南检索需另寻数据源。

10.4 用法四:评测与对照实验

  • 直接用 XMedBench(六语言)评测自研模型,与论文 Tab.3 的 20+ 模型分数对标;
  • 用语料做"领域增益"对照实验:同基座 ± ApolloCorpus 续训,直接引用 Tab.3 增幅区间(+6.3 到 +18.3 分)作预期管理;
  • 低资源语言研究:HI/AR 侧的数据稀缺实物本身即是研究素材(低资源医疗 NLP 的数据可得性案例)。

10.5 语言覆盖实操速查

需求语言 预训练可得 SFT 可得 质量预期
英语 EN 五类齐全(约 1,546M token,含 qa 副本) 五类齐全 最高;论文/书籍/指南原生内容为主
中文 ZH 四类(无 guideline 分片,约 621M) 五类齐全 高;对话/考试借力 HuatuoGPT/CMB 资产
西班牙语 ES 两类(paper/web,约 122M) 三类(general/math 无,exams/patient 有) 中;考试与对话可用
法语 FR 两类(paper/wiki,约 29M) 三类 中低;FrenchMedMCQA 评测可补偿
印地语 HI 一类(wiki 209 行 / 0.5M token) 一类(general 43.9M) 低;评测有翻译版 MMLU_HI
阿拉伯语 AR 无预训练分片 两类(general 18.7M + patient) 低;预训练需自补 MAQA 等

§11 同期多语言/医疗语料对比:ApolloCorpus 在版图上的位置

11.1 横向对照(论文引文网络 + 公开口径)

语料/数据面 主导语言 医疗覆盖 发布体量 许可 与 ApolloCorpus 的差异点
ApolloCorpus(本条目) 6 语言 预训练+SFT 全栈 2.5B tokens / 22.3 GB Apache-2.0 唯一把"预训练+SFT+基准+模型"四件套配齐的多语言医疗发布
MEDITRON-70B 语料面 EN 指南+论文 约 475M token 级(指南精选+PubMed 集合) 多源各异 单语深挖指南;Apollo 走广度,Meditron 走英文深度
PMC-LLaMA 语料面 EN 论文+书籍 约 4.8M 论文+30k 书籍口径 多源各异 学术文献中心主义;无对话/考试/网络分片
BioMistral 语料面 EN(评测多语) 论文(PubMed Central) 期刊语料+多语言评测 CC 系 首提多语言评测视角,但训练语料仍英文中心
MMedLM2 语料面 EN/ZH 为主 论文+教材+网络 约 32B token 口径 逐源声明 体量大两个量级但语言少于 6;评测用 MMedBench
HuatuoGPT-II 语料面 ZH/EN 论文+书+对话 未全量开源 部分 Apollo 的 ZH 对话上游;闭源成分高
通用多语言(mC4 等) 100+ 语言 医疗混于全网 TB 级 OSL 系 无医疗策展;Apollo 相当于"医疗策展版切片"

11.2 差异化定位三句话

  1. 对多语言医疗这一格:2024 年时点上,ApolloCorpus 是第一个把六种语言的医疗预训练+SFT 成规模打包并 Apache-2.0 发布的语料——它填补的是"非英语医疗预训练数据无正式发布渠道"的空档。
  2. 对英语/中文医疗语料:它不是最大也不是最深(MEDITRON 的指南深度、PMC-LLaMA 的论文广度都超过它对应分片),它的英文/中文价值在于"与五语言共训练"的配比方案本身。
  3. 对数据集工程教学:Tab.2 的 token 账本 + 消融实验(QA 改写/混合训练)+ 基座配对表,构成一份少见的"数据-训练-评测"三方对账样本,适合作为数据工程课程的 dissect 标本。

11.3 引用格式(README 建议原文)

@misc{wang2024apollo,
   title={Apollo: Lightweight Multilingual Medical LLMs towards Democratizing Medical AI to 6B People},
   author={Xidong Wang and Nuo Chen and Junyin Chen and Yan Hu and Yidong Wang and Xiangbo Wu and Anningzhe Gao and Xiang Wan and Haizhou Li and Benyou Wang},
   year={2024},
   eprint={2403.03640},
   archivePrefix={arXiv},
   primaryClass={cs.CL}
}

(注意:此 BibTeX 列 10 作者,较 arXiv abs 页 12 作者少 Guorui Zhen、Chunxian Zhang——坑 6。)

§12 进阶 FAQ:六个深入问题

Q1:为什么说这是"方法论文驱动的发布",与"数据集论文驱动的发布"有何不同?
传统数据集论文(如库内大量标注型条目)以"数据本身的新颖性"立论——新采集、新标注、新类别体系。Apollo 论文以方法立论(QA-Augmented Pre-training、Mix Training、Proxy-Tuning),语料是方法的输入与证物:论文的全部数字(Tab.1-5)围绕"怎么喂"而非"数据长什么样"。这决定了它的 FACTS 密度分布:token 账本、采样公式、消融分数一应俱全,而逐条文本的质量抽检、来源许可逐条清单阙如。使用时的预期应据此校准。

Q2:3,741,196 行里,一条"行"到底多大?
viewer 实测 medicalWeb_zh 的 text 字段长度分布为 32 至 34,700 字符,其他分片未逐条公布分布。粗略对账:2.5B tokens ÷ 3.74M 行 ≈ 每行 677 token(仅按 pretrain text 口径,混合多语言与多类目),即多数行是"段落-短文"粒度而非整章整篇——切块入库时按行即块是合理起点,Web 分片建议再按句切。

Q3:_qa 文件与 _text 文件可以混着训练吗?
可以且被论文验证:消融显示 QA 视图相对原始续训"整体无损",Mix 配方下 QA 视图还略优(QAData-Mix 38.53 vs ParaData-Mix 35.40,Tab.4 口径)。工程上建议两种视图都进池子,由采样策略控制占比;但要意识到 _qa 是 ChatGPT 改写物——它承载的是"改写者模型"的医疗知识水平(2023-2024 年的 GPT-3.5/4),不是原文本作者的。

Q4:medicalExam 的 _dup/_clean/_dup_question 变体文件是什么?
文件名与数量(en/es/fr/zh 各三份变体)表明团队对考试题分片跑过去重流程:_dup 应为未去重/含重复的原始抽取,_clean 为清洗版,_dup_question 为按题干判重的中间产物(推断性命名解读,论文未逐文件说明——待核 T4)。实用建议:直接用 _clean 版,其余作审计留档。

Q5:为什么 Apollo 论文要顺便发 XMedBench,而不是只用现成基准?
因为印地语与阿拉伯语当时没有本源医学多选基准——"六语言评测"无从谈起。论文的做法是翻译 MMLU 医学子集(六子集:Clinical knowledge、Medical genetics、Anatomy、Professional medicine、College biology、College medicine)并请专业医师校验,凑齐 HI/AR 两侧;ES/FR/ZH/EN 则直接用本源基准(HeadQA、FrenchMedMCQA、MedQA-MCMLE/CMMLU、MedQA-USMLE/MedMCQA)。这也是为什么 XMedBench 的 HI/AR 组件实为 MMLU 翻译版——解读阿语/印地语分数时要记得它们的"原生性"弱于 ES/FR 侧。

Q6:Apollo-34B/72B 是从哪来的?论文里没提。
论文正式规模只有 0.5B/1.8B/2B/6B/7B(Tab.3 配对表);34B/72B 出现在 GitHub README 的模型清单与对比分组(使用 Qwen 风格特殊 token 模板,推断为 Qwen 系基座的后续扩展,论文未附训练与评测细节)。引用"Apollo 系列"性能结论时应限定在论文五款;34B/72B 只能作存在性引用。

§13 伦理与治理视角:一份"民主化"叙事的诚实对账

13.1 叙事与实物的落差

论文标题的 “6B People” 与图 1 的"语言-预期寿命"可视化,把 ApolloCorpus 定位为低资源地区的医疗基础设施。实物对账:英语占 token 约 61%,印地语约 1.7%,阿拉伯语约 1.1%;HI 预训练文本仅 209 行,AR 预训练分片缺席。这不是作者失信——他们在 Tab.2 里把稀缺如实写了出来——但引用"六语言覆盖 61 亿人"时应同时引用 token 配比,避免读者形成均衡覆盖的错觉。

13.2 生成式改写的知识治理

语料中两类内容是"模型写的":预训练 _qa 副本(ChatGPT 改写)与 SFT general 分片(GPT-4 生成/WizardLM 法)。其医疗陈述的可靠性受制于生成时点的基础模型水平,且未经逐条医学审核的公开记录。用于医疗问答产品前,建议:① 以 medicalExam(人类出题)与 Dialogues 源头数据(MAQA 是真实问答、HuatuoGPT 对话源自真实语料改写)为高信任层;② _qa 与 general 分片标记为"生成文本层"并按用例分级使用。

13.3 论坛文本与患者隐私

medicalWeb 分片源自在线医疗论坛(论文注明),虽属公开发言,但患者叙事中自曝的可识别信息(用药、病程、地区)难以从技术面完全排除;发布方未公开 PII 处理流程的独立审计。RAG/对话产品接入该分片前建议跑一遍 PII 扫描与过滤。

13.4 许可治理的三层观

第一层是发布许可(Apache-2.0,明确且宽松);第二层是底层文本版权(书籍/论文/试题的原生权利不因再发布而消灭,坑 5);第三层是生成内容的责任链(改写 prompt 由发布方设计,生成内容的风险归属在商用司法实践中仍在演化)。三层各自独立,逐层核查是稳妥姿势。

13.5 冻结发布的利与弊

语料自 2024-09 起未更新,这带来双面性:利——引用可复现、内容不漂移、下游实验可比;弊——2024 年后的医学知识(新指南、新药、新共识)自然缺席,直接用于临床知识密集任务时会带着"2024 年中之前的世界观"。生产系统应将其视为基座知识源之一,配时效性内容更新机制。

附录 A:数据档案速查卡

维度 内容
类型 多语言医疗 LLM 训练语料(继续预训练 + SFT 双阶段,文本型)
论文 arXiv:2403.03640(v1 2024-03-06 / v6 2024-10-12,Preprint)
团队 FreedomIntelligence(港中深 + 深圳大数据研究院),通讯 Benyou Wang
规模 3,741,196 行(pretrain_text 13 splits 口径)/ 22.3 GB(页面口径)/ 2.5B tokens(论文口径)
语言 en/zh/es/fr/hi/ar(六语言宣传口径);HF 预训练实物五语言,ar 仅 SFT
结构 pretrain:{source}{lang}{text\
方法 QA-Augmented Pre-training + Mix Training(priority sampling π=16/2)+ Proxy-Tuning
衍生模型 Apollo 0.5B/1.8B/2B/6B/7B(基座 Qwen/Gemma/Yi 混合)+ 34B/72B + MedJamba + ApolloMoE
基准 XMedBench(六语言);Apollo-7B avg 58.78(GPT-3.5 57.80;≤70B 开源居首)
许可 Apache-2.0(HF API 一手确认,无 gated)
抓取时点 2026-09-28
库内互链 medmcqa(111)/headqa(120)/cmb-cmexam(180)/pmc-oa(320)/s2orc(370)/meddialog(210)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 HF dataset card + arXiv 论文 + GitHub 三入口互链,名称唯一性高;唯 ApolloCorpus/ApolloCorpora 双写法与 Apollo 模型系同名干扰(坑 1)微降分
A 可获取性 9 Apache-2.0、无 gated、直链/整包/脚本三通道、22.3 GB 一次性可得;扣分项:低带宽环境下载成本、HF 主站可达性区域差异
I 可互操作 8 JSON 标准格式、HF datasets config 化(pretrain_text 13 splits)、文件命名自解释;SFT 无统一 config 需手动挂载、_qa 副本不在默认 config 内微降分
M 元数据质量 7 论文 Tab.2 token 账本精确到 0.1M、训练配方完整公开;但 HF 卡语言列表有笔误、行数-体积多口径并存、变体文件无文档(待核 T4)
S 可持续性 6 依托 HF/GitHub 平台稳定、发布已冻结可复现;但 2024-09 后无维护、无修订版机制、上游(如 MAQA)可得性不受本项目控制
综合评级 7.6/10(良) 可获取性与配方透明度是长板;元数据小笔误与冻结式维护是短板。在"文本语料类"库内条目中属可获取性第一梯队

附录 C:逐项证据链自证

关键数字/事实 来源 位置/方式
3,741,196 rows / 22.3 GB / downloads HF 页面快照 huggingface.co/datasets/FreedomIntelligence/ApolloCorpus(搜索快照直读)
license apache-2.0 / usedStorage 39,147,380,685 B / createdAt / lastModified / 13 splits / siblings 文件清单 HF API hf-mirror.com/api/datasets/FreedomIntelligence/ApolloCorpus(一手 JSON,2026-09-28)
2.5B tokens / Tab.2 token 账本 / π=16,2 / batch 256 / lr 1e-5 / 36,107 词条 论文 HTML v6 arxiv.org/html/2403.03640v6(curl 全文抓取 + 表格解析,一手)
基座配对(Qwen×2/Gemma×2/Yi×1)/ Apollo-7B 58.78 / GPT-4 73.37 / GPT-3.5 57.80 论文 Tab.3 同上(HTML 表格逐行解析,一手)
六语言覆盖 6.1B 人口 / 132 国家地区 论文 §1 脚注 同上(一手)
PMC-Patients/HuatuoGPT/Huatuo_26M/MAQA/CMB/ShareGPT/Alpaca/WizardLM/belebele/ai2_arc/Capybara 溯源 论文 §3.1 同上(一手)
时间线五事件 / usage format 双模板 / GGUF 致谢 GitHub README github.com/FreedomIntelligence/Apollo 页面(一手渲染页)
arXiv v1-v6 日期链 / 12 作者 / DOI arXiv abs 页 arxiv.org/abs/2403.03640(一手)
viewer 行数分布(medicalWeb_zh 32-34.7k 字符等) HF viewer 快照 huggingface.co/datasets/.../viewer/pretrain_text/medicalWeb_zh?p=312(搜索快照)
“Qwen architecture as a backbone”(二手转述,已被一手表格修正) Lacuna/BearPlex 第三方分析页(仅用于坑 7 存照)
Scholar 被引 71 / arxiv.gg Cited by 19 搜索快照 2026-09-28(仅背景,不作为硬数字)
DB 查重 0 命中 库内只读查询 SELECT ... WHERE url_name ILIKE '%apollo%' → (0 rows)

附录 D:获取决策树

你的需求是什么?
├── 做多语言医疗 LLM 继续预训练
│   ├── 1) 按语言需求核对附录 J 语言表(注意 ar 无预训练分片——坑 2)
│   ├── 2) load_dataset("FreedomIntelligence/ApolloCorpus", "pretrain_text") 取 13 splits
│   ├── 3) 另取 train/pretrain/*_qa.json 双视图 + train/sft/ 指令数据
│   └── 4) 按 §4.3 配方(π=16/2 混合采样)训练
├── 只做医疗 SFT
│   ├── 需要阿拉伯语/印地语 → general_* 文件(唯一均衡项)
│   ├── 需要医患对话 → medicalPatient_{ar,en,zh}.json
│   └── 需要考试题 → medicalExam_*_clean.json(用 clean 版,见 §12-Q4)
├── 搭 RAG 语料库
│   ├── 首选 medicalBook/medicalWiki/medicalGuideline/medicalPaper 的 _text 分片
│   ├── 排除或降权 medicalWeb(论坛噪声,§13.3)
│   └── 按行切块(行均约 677 token),Web 分片再按句切
├── 复现论文成绩
│   ├── GitHub FreedomIntelligence/Apollo → bash 0.download_data.sh
│   └── XMedBench 下载注意坑 4(HI/AR 链接互换)
└── 只想引用数据集
    ├── 数据口径:3,741,196 行(pretrain_text 口径)/ 22.3 GB / 2.5B tokens
    ├── 引用条目:README BibTeX(坑 6 署名差异自知)或 arXiv abs v6
    └── 语言表述:写"六语言(预训练发布五语言)"最稳妥

附录 E:术语表

术语 释义
ApolloCorpus / ApolloCorpora 同一语料的 HF 名(单数)与论文名(复数),坑 1
Continue Pretrain(继续预训练) 在已预训练基座上用领域语料续训,本语料的主设计用途
QA-Augmented Pre-training 用 ChatGPT 把预训练文本改写成医患问答对再训练,防指令能力遗忘(论文方法)
Mix Training 预训练与指令数据混合采样、平滑过渡的训练编排
Priority Sampling 按权重 π 的动态采样:本配方 π=16(预训练)、π=2(指令)
Proxy-Tuning 用小模型微调前后的 logit 偏移在推理时修正大模型,免改权重
XMedBench 配套六语言医疗多选基准(EN/ZH/ES/FR/HI/AR 六组件组)
FreedomIntelligence 港中深 + 深圳大数据研究院的医疗 AI 团队(CMB/HuatuoGPT 同门)
medicalWeb 论坛来源网络医疗内容分片(本语料最大单项 886.7M token)
medicalPatient SFT 医患对话分片(ar/en/zh 三语言)
MAQA 最大阿拉伯医疗问答数据集(Abdelhay & Mohammed 2022),AR 对话源头
Huatuo_26M 中文医疗指令数据集(Li et al. 2023b),ZH 对话源头之一
cr:RecordSet Croissant 元数据里的记录集节点(本条目 frontmatter 已按节点式写入)

§14 库内互链详注:六个 rid 的连接逻辑

本节把 §7.3 的互链总表逐条展开——每条说明"为什么这两个条目应该互相引用"以及"联读时看什么"。rid 为库内 record_id(2026-09-28 只读核验)。

14.1 medmcqa(111) —— XMedBench-EN 的题源同门

MedMCQA 是印度医学入学考试(AIIMS/NEET-PG 体系)的多选题数据集,约 194k 题;在本条目语境里它身兼两职:其一是 ApolloCorpus 之外的独立评测组件(XMedBench-EN 三组件之一),其二是"考试题驱动医疗 LLM"路线的代表数据源。联读要点:ApolloCorpus 的 Exams-EN 分片(42.1M token)与 MedMCQA 同属考试题语料但规模口径不同——前者是 token 计的预训练/微调材料,后者是按题计的评测集;在 medmcqa 条目上训练的模型可用 XMedBench-EN 分数与本条目 Tab.3 直接对标。

14.2 headqa(120) —— 西班牙语侧的桥梁

HeadQA 源自西班牙医疗专业资格考试(SPANISH MD/PSY/CO/EN/NUR 考试),约 2.6k 题 × 多年版本;它是 XMedBench-ES 的唯一组件,也是 ApolloCorpus 六语言版图里"西班牙语医疗 AI"的评测锚点。联读要点:Apollo-6B 在 HEAD-QA 上 58.47、Apollo-7B 63.73(Tab.3 一手),而基座 Yi-6B 仅 47.01——西语侧的领域增益案例可以直接引这两行;在 headqa 条目讨论"西班牙语医学 QA 生态"时,本条目提供了把 HeadQA 用作多语言基准组件的范式样本。

14.3 cmb-cmexam(180) —— 既是上游又是基准

CMB(Chinese Medical Benchmark)与 CMB-Exam 是 FreedomIntelligence 团队的中文医疗考试资产;在 ApolloCorpus 里它是双向连接:训练侧,CMB 训练集被直接并入 Exams-ZH 分片(35.3M token);评测侧,CMB-single(随机抽 2,000 单选)进入 XMedBench-ZH 组件清单(论文未用,但 README 列出)。联读要点:用 cmb-cmexam 条目数据训练过的模型,若又在 XMedBench-ZH 上评测,存在训练-评测同源风险——这正是论文 §3.1 “Data Leakage Checking” 专节存在的原因;联读时关注库内 cmb-cmexam 条目的许可与切分说明,判断自家管线是否需要隔离。

14.4 pmc-oa(320) —— medicalPaper-EN 的量级参照

PMC-OA 是 PubMed Central 开放获取文献的图文语料集;ApolloCorpus 的 Papers-EN 分片(252.9M token)与之同域同源生态。联读要点:pmc-oa 提供"文献原文+图"的多模态视角,ApolloCorpus 的 paper 分片提供"纯文本+QA 改写"的训练视角——两者拼起来恰好覆盖"文献→模型"的两种数据形态;讨论 PMC 文本的许可层级(CC BY/CC BY-NC/CC BY-NC-ND 混合)时,可对照本条目 §5.1 的"发布许可≠底层文本版权"三层观。

14.5 s2orc(370) —— 大规模文献语料的对照系

S2ORC 是 Semantic Scholar 的开放学术全文语料(1.36 亿篇级);它与本条目的关系是"量级参照系":ApolloCorpus 全部六语言 2.5B tokens,尚不及 S2ORC 英文文献 token 的零头。联读要点:任何"要不要在 ApolloCorpus 之外再补 PMC/S2ORC 论文语料"的容量决策,可引用两者的数量级对比;S2ORC 无医疗策展,ApolloCorpus 的价值恰在策展层(词典过滤、长度过滤、QA 改写)——两者是"原料矿"与"精炼料"的关系。

14.6 meddialog(210) —— 医患对话的同类对照

MedDialog(英文+中文在线医疗对话)是本库医患对话类的代表条目;ApolloCorpus 的 Dialogues 分片(EN 92.1M + ZH 46.6M + AR 10.4M token)与之同类但来源不同:前者是在线问诊平台的真实对话,后者是"真实语料/题库改写+生成"的混合(EN 系 ChatGPT 从 PMC-Patients 改写、ZH 系 HuatuoGPT 资产、AR 系 MAQA 抽取)。联读要点:训练"医生口吻"模型时,meddialog 提供真实语体、ApolloCorpus 提供受控改写体——两者对风格迁移的贡献可做消融;§13.2 的"生成文本层/真实文本层"信任分级在两个条目间同样适用。

14.7 互链使用建议(编辑部口径)

  1. 上述六条均为双向建议互链:本条目出"多语言训练语料"视角,对侧出"单语种/单形态数据"视角。
  2. 引用 rid 时以库内 record_id 为准(111/120/180/320/370/210),条目 url_name 以 ai_ready_dataset 表实时查询为准。
  3. 建议未来条目(如 MEDITRON、BioMistral、MMedLM2 若入库)反向链接本条目的 Tab.2 token 账本——该表是多语言医疗语料配比讨论的公共参照物。

§15 结语:一份语料的两种读法

作为数据的读法:ApolloCorpus 是 22.3 GB、六语言、Apache-2.0 的医疗文本原料库——英文/中文侧丰厚(书籍、论文、百科、指南、论坛五类俱全),西语侧够用,法/印地/阿拉伯语侧单薄;SFT 侧五类指令数据在六语言间基本铺齐。它不承诺均衡,只承诺可得。

作为方法的读法:它把"多语言医疗 LLM 怎么喂"的完整配方公之于众——token 账本精确到 0.1M、改写流水线固化为 _qa 文件、采样公式写出 π 值、五个基座的对照实验证明配方可迁移。对想要复刻"非英语医疗 LLM"的团队,这份配方的可复制价值不亚于数据本身。

两种读法合起来,是它在 AI-Ready 光谱上的位置:发布纪律接近满分(许可、格式、通道),数据审计留有空白(质量抽检、PII 流程、生成标注)。把它当原料与教材,收益最大;把它当"即插即用的成品知识库",需要带上 §8 的八个坑与 §13 的四条治理提示。

附录 F:Apollo 模型系规格卡(语料的下游产物,对照检索用)

模型 基座 架构家族 XMedBench avg 对话模板 发布物
Apollo-0.5B Qwen-0.5B Qwen 37.47 User:/Assistant: + `<\ endoftext\
Apollo-1.8B Qwen-1.8B Qwen 44.74 同上 HF 权重;亦作 proxy-tuning 代理
Apollo-2B Gemma-2B Gemma 39.94 同上 HF 权重 + GGUF
Apollo-6B Yi-6B Yi 57.54 同上 HF 权重 + GGUF
Apollo-7B Gemma-7B Gemma 58.78 同上 HF 权重 + GGUF;论文旗舰
Apollo-34B / 72B (论文未附细节;模板为 Qwen 风格特殊 token) 推断 Qwen 系 未入论文 Tab.3 `<\ User\
Apollo-MedJamba Jamba(AI21) hybrid SSM-Transformer 未入论文 — 2024-04-25 发布,独立 repo
ApolloMoE MoE 架构 — 未入论文 — 2024-10-15 发布,宣称 50 语言

读表提示:① 五款正式模型的基座是"Qwen×2 + Gemma×2 + Yi×1"混合(坑 7);② Apollo-7B 增幅最小(+6.34)但绝对分最高——基座 Gemma-7B 本身多语言底子好;③ Apollo-0.5B 增幅最大(+18.30),"小模型吃领域语料性价比最高"结论即由此而来。

附录 G:XMedBench 组件 × 库内条目对应总表

XMedBench 组件 语言 数据性质 库内条目(rid) 关系
MedQA-USMLE EN 美国医师执照考试题 无独立条目 论文评测组件;题源与 Exams-EN 同类
MedMCQA EN 印度医学考试题 medmcqa(111) 直接对应——独立评测组件入库
MMLU-Medical(六子集) EN/HI/AR 通用医学多选(HI/AR 为翻译版) 无独立条目 HI/AR 侧唯一评测源;医师校验翻译
MedQA-MCMLE ZH 中国医师考试题 无独立条目 ZH 评测组件
CMMLU-Medical(七子集) ZH 中文医学多选 无独立条目 ZH 评测组件
CMB-single ZH 随机 2,000 单选 cmb-cmexam(180) 同源——README 列示、论文未用
CExam ZH 随机 2,000 单选 cmb-cmexam(180) 同上
HEAD-QA ES 西班牙卫生专业考试 headqa(120) 直接对应
FrenchMedMCQA FR 法语医学考试 无独立条目 FR 唯一评测组件

检索提示:从库内 medmcqa(111)/headqa(120) 条目进入的读者,可用本表"向上"找到它们在多语言医疗基准体系中的位置;从 ApolloCorpus 进入的读者,可"向下"把六语言评测拆解为单语种数据集逐一深究。

附录 H:Pilot Study 全表(Tab.1 转录)——多语言协同的一手证据

论文 §2.2 用 Qwen-1.8B 做了一组先导实验:同一批数据分别按"六语言各训一个单语模型"与"六语言混合训练"两种设置训练(XMedBench 六语言平均分):

设置 EN ZH FR ES AR HI Avg
基座 Qwen-1.8B 32.91 40.07 22.12 27.43 23.71 8.82 25.84
Apollo-English(单语) 39.44 45.27 28.35 31.76 22.61 8.72 29.36
Apollo-Chinese(单语) 39.42 61.13 28.97 33.83 27.94 25.34 36.11
Apollo-French(单语) 30.94 32.71 23.81 27.00 24.54 1.74 23.46
Apollo-Spanish(单语) 33.84 43.81 27.41 35.39 28.40 23.88 32.12
混合多语言(Apollo 配方前身) — — — — — — 见主表 44.74

三个结论(论文原文口径):① 单语训练除 Apollo-Chinese 外普遍弱于混合训练;② 最戏剧性的对照是 Apollo-French(23.46)甚至低于其基座(25.84)——法语侧数据稀薄时单语继续训练反而有害;③ 混合训练让 HI 从 8.82 升至显著水平、AR 从 23.71 同步受益——“多语言协同”(multilingual synergy)即指此现象。这组数字是"为什么低资源语言医疗 LLM 应该混合训练"的最简明引用源。

附录 I:检索与引用十误区(速排)

  1. 把 Apollo-6B 当"6B People"的 6B——前者是参数量,后者是语言覆盖人口(§2.3)。
  2. 把 ApolloCorpus 当评测基准——它是训练语料;评测用 XMedBench(两件套不同用途)。
  3. 引用 “An Lightweight” 旧标题——v6 已定稿 “A Lightweight”(坑 6)。
  4. 以为 22.3 GB 包含全部 qa 副本行数——3,741,196 行只是 _text 侧口径(坑 3)。
  5. 按六语言预期找阿语预训练分片——没有,ar 仅 SFT(坑 2)。
  6. 顺 GitHub README 链接下 HI/AR 评测集——链接互换,会拿错语言(坑 4)。
  7. 给 Apollo-7B 套 Qwen tokenizer/模板——7B 基座是 Gemma-7B(坑 7)。
  8. 给 34B/72B 套 7B 对话模板——两套模板(坑 8)。
  9. 把 Apache-2.0 当底层文本版权豁免——三层许可观(坑 5、§13.4)。
  10. 把"2024.02.12 published"当 HF 上线日——HF repo createdAt 是 2024-03-06(坑 7 关联)。

附录 J:六类数据分片深读

J.1 medicalBooks —— 教科书质地的基础盘

规模与语言:413.8M tokens(EN 296.7M + ZH 117.1M),预训练侧第二大单项;HF 上 medicalBook_en 553k 行、medicalBook_zh 500k 行(viewer 口径,text 侧)。

内容质地:医学教材与专著文本——概念定义密集、行文体系化、术语规范。这是六类分片中最接近"教科书学习体验"的一类,也是 QA 改写收益最直观的一类(教材天然自带"知识点-解释"结构,改写成问答对后几乎无损)。

使用建议:领域继续预训练的打底料;做医学教育类应用(题库解析、概念解释)时优先取用;英文分片可与库内其他英文医学文献语料形成"教材+期刊"双轨。

注意事项:书籍文本的版权敏感性在六类中最高(附录 J 各类通用提示见 J.7);部分书籍文本可能含图表引用残留("如图 X 所示"类空指),做 RAG 时需清理。

J.2 medicalPapers —— 学术前沿的窄门

规模与语言:349.0M tokens(EN 252.9M + ZH 45.6M + ES 46.0M + FR 4.5M)——注意 ES 论文 token(46.0M)竟高于 ZH(45.6M),是西语侧预训练的意外主力。

内容质地:同行评审论文文本——摘要-方法-结果-讨论的结构性最强,术语密度最高,缩写最泛滥。对基座 tokenizer 的领域适应性要求也最高(新药名、基因名、计量单位)。

使用建议:提升模型"读文献"能力的核心料;与库内 pmc-oa(320)/s2orc(370) 联合使用时注意本分片可能与其重叠(论文未给去重清单),建议按 DOI/标题哈希先去重。

注意事项:法文论文仅 4.5M token——"法语医疗 LLM"的论文语料支撑主要就得靠这些,预期要放低。

J.3 medicalWikis —— 百科式概览与低资源现实

规模与语言:226.2M tokens(EN 221.1M + FR 4.6M + HI 0.5M);HF 行数 medicalWiki_en 239k、medicalWiki_fr 8.39k、medicalWiki_hi 209。

内容质地:医学百科条目——定义清晰、覆盖面广、深度中等。英文侧经词典过滤(36,107 个医学词条入选),是"概念对齐"的好材料;HI 侧 209 行的现状是印地语医学百科体量的诚实记录。

使用建议:RAG 库的"骨架层"(概念查询命中率高);做实体链接/术语归一时可用作词典补充;HI 分片建议只作存在性样本,不作为 HI 预训练主力。

注意事项:百科内容有版本时点(2024 年前后快照),医学指南更新的领域(如肿瘤治疗方案)需人工复核时效性。

J.4 medicalDialogues(论文口径)与 medicalPatient(HF 口径)—— 最特殊的一类

规模与语言:论文 Tab.2 记 149.1M tokens(EN 92.1M + ZH 46.6M + AR 10.4M)作继续预训练;HF 发布侧对应物是 SFT 的 medicalPatient_{ar,en,zh}.json——HF 的 pretrain 目录里没有对话分片(坑 2 的核心案例)。

内容质地:三源三性——EN 系 ChatGPT 从 PMC-Patients 病例报告改写的多轮问诊(合成度高、医学结构好);ZH 系 HuatuoGPT/Huatuo_26M 现成资产(真实问诊改写);AR 系 MAQA 真实问答的长度过滤子集(最接近真实患者语体)。

使用建议:训练"问诊语气"与多轮对话能力的主料;AR 侧若做预训练需回源 MAQA 自行补充原始文本。

注意事项:EN 对话的"患者叙述"由模型生成,含虚构病例细节——医疗事实抽取任务不要把它当真实病历(与库内 ehrsql/mimiciii 等真实 EHR 条目严格区分)。

J.5 medicalGuidelines —— 最小也最金贵

规模与语言:29.6M tokens,仅 EN;HF medicalGuideline_en 99.7k 行。

内容质地:临床实践指南文本——循证等级、推荐意见、剂量阈值高度密集,是六类中"单位 token 医疗决策价值"最高的一类,但也是低资源语言完全缺席的一类(几乎没有开放的非英文指南语料)。

使用建议:临床决策支持类应用的精饲料;做指南问答/RAG 时按"推荐意见段落"细粒度切块而非按行。

注意事项:指南有时效性(同一机构会撤换旧版),2024 年快照中的部分推荐可能已被更新——临床类产品必须配版本治理。

J.6 medicalWeb —— 最大的单项,最小的信任

规模与语言:886.7M tokens(EN 499.9M + ZH 329.3M + ES 57.5M),占全语料约 35%;HF 行数 medicalWeb_zh 641k、medicalWeb_en 394k、medicalWeb_es 153k。

内容质地:在线医疗论坛与问答(论文注明 “from online forum”)——患者叙事、经验分享、非专业提问与专业回答混杂。viewer 实拍样本(中文分片)显示内容为"癌症晚期食欲不振机制"类长科普贴,医学细节丰富(受体机制、药物副作用)但行文口语化、可靠性参差。

设计意图:作者明言这是刻意的——模拟医学生"核心课程之外的网络信息摄取",让模型适应真实互联网上患者实际会读到的文本分布。

使用建议:继续预训练可用(配比按论文);RAG 与直接面向患者的生成任务建议排除或降权;做医疗信息抽取研究时它反而是好素材(真实患者语体的 NLP 任务)。

注意事项:PII 风险六类中最高(患者自曝信息),§13.3 的扫描建议主要针对此类;论坛内容的原生许可状态最模糊。

J.7 六类速查总表

分片 token 语言 HF 行数(text 侧) 信任梯度 最佳用途
medicalWeb 886.7M en/zh/es 641k/394k/153k 低 预训练配比、语体适应
medicalBook 413.8M en/zh 553k/500k 中高 预训练打底、概念解释
medicalPaper 349.0M en/zh/es/fr 878k/177k/89k/8.28k 高 文献理解、术语适应
medicalWiki 226.2M en/fr/hi 239k/8.39k/209 中高 概念对齐、RAG 骨架
medicalDialogues/Patient 149.1M en/zh/ar 见 SFT patient 文件 分层(AR 真实>EN 合成) 对话能力、问诊语气
medicalGuideline 29.6M en 99.7k 高 决策支持、RAG 精料

(信任梯度为编辑部基于"来源真实性×人工审核可见度"的定性评级,非论文口径。)

附录 K:论文相关工作 landscape(引用网络速览)

论文 Related Work 与引文图勾画的 2024 年初医疗 LLM 版图,按与本条目的关系分层:

层 工作 与 ApolloCorpus 的关系
英文医疗 LLM(单语深挖) Meditron-70B、PMC-LLaMA、MedAlpaca、BioMedLM、BioGPT 对照组:证明"英文中心"路线在非英语侧失效,反衬本语料的多语言定位
中文医疗 LLM HuatuoGPT(I/II)、DoctorGLM 等 既有资产复用(ZH 对话/考试直接并入)+ 对照组(Huatuo2-7B/13B 入 Tab.3)
多语言先驱 BioMistral(多语言评测)、BiMediX(双语)、MMedLM/MMedLM2(EN/ZH)、Medical mT5 同赛道:语言数、数据开放度、模型规模三维对比的对手席
评测供给 MedQA(USMLE/MCMLE)、MedMCQA、HeadQA、FrenchMedMCQA、MMLU、CMB XMedBench 的组件来源;库内 medmcqa(111)/headqa(120)/cmb-cmexam(180)
数据供给 PMC-Patients、Huatuo_26M、MAQA、ShareGPT、Alpaca、WizardLM、belebele、ai2_arc、Capybara 语料的上游拼图(§7.1)
训练技术 proxy-tuning(Liu et al. 2021 反专家法)、continue-pretraining 文献 Proxy-Tuning 章节的学术根基

后续引用网络(arxiv.gg/Google Scholar 口径,2026-09-28):Aqulia-Med、Me LLaMA、MedGemma 技术报告、Large Language Models 相关综述、Med-CoReasoner 等工作引用本论文——ApolloCorpus 与 XMedBench 已成为多语言医疗 LLM 论文的标准对照物。

附录 L:复现工程清单(从零到跑通)

以下清单按"论文复现流水线"整理(GitHub README 七步 + 论文超参),供数据工程侧直接取用:

  1. 环境:repo 要求见 requirements.txt;多节点训练脚本在 scripts/multi_node_train_*.sh。
  2. 取数:bash 0.download_data.sh(2024-09-13 更新版)——拉取 ApolloCorpus 并按模型整理;或手动 HF 下载(§5.2 三通道)。
  3. 评测集构造:bash 1.data_process_test\&dev.sh——按目标基座的特殊 token 构造 test/dev;用 ./util/check.ipynb 校验 special tokens。
  4. 训练集构造:bash 2.data_process_train.sh——预分词 + 训练顺序/epoch 调整(此处可注入 §4.3 的采样策略)。
  5. 训练:bash 3.single_node_train_gemma.sh(Gemma-2b 示例);batch 256、lr 1e-5(论文设定)。
  6. (可选)Proxy-Tuning:bash src/proxy-tuning/scripts/eval/proxy_tuning.sh——小模型对(基座+Apollo)作 logit 偏移。
  7. 评测:bash 4.eval.sh 生成基准分数;协议:3-shot、正则抽选项、生成 2-128 tokens、0.5B 全精度其余半精度。
  8. 对数:跑完与论文 Tab.3 对应行核对(Apollo-7B 58.78 为旗舰锚点);偏差大时优先排查坑 4(HI/AR 数据拿错)与坑 8(模板用错)。

三条经验提示:① viewer 的 13 splits 只是 _text 侧,复现要记得补 _qa;② medicalExam 有 _clean/_dup 变体,直接用 _clean;③ 阿语侧按论文叙述补 MAQA 原始文本,否则 AR 分数复现会低于论文(坑 2 的训练侧后果)。

附录 M:HF API 元数据全字段转录(一手 JSON,2026-09-28)

以下为 hf-mirror.com/api/datasets/FreedomIntelligence/ApolloCorpus 返回的关键字段原样转录(省略无关字段),供复核与追溯:

字段 值
id FreedomIntelligence/ApolloCorpus
author FreedomIntelligence
sha c1ee58d62a26a2422d01749517435fb0d716d449
lastModified 2024-09-13T16:45:12.000Z
private / gated / disabled false / false / false
tags license:apache-2.0 · size_categories:1M<n<10M · format:json · modality:text · library:datasets · library:pandas · library:polars · library:mlcroissant · arxiv:2403.03640 · region:us
downloads(API 时点) 1,242
likes 41
createdAt 2024-03-06T13:03:28.000Z
usedStorage 39,147,380,685 bytes
cardData.license apache-2.0
cardData.configs config_name: pretrain_text · 13 个 split(data_files 指向 train/pretrain/*_text.json)

config pretrain_text 的 13 个 split → 文件映射(原样):medicalBook_en → train/pretrain/medicalBook_en_text.json;medicalBook_zh → …_zh_text.json;medicalGuideline_en;medicalPaper_en/es/fr/zh;medicalWeb_en/es/zh;medicalWiki_en/fr/hi——即预训练 text 侧五语言 × 五源的全部组合中已发布的 13 个(books 缺其他语言、guideline 仅 en、wiki 仅 en/fr/hi——未发布的组合在 HF 上无文件,与论文 Tab.2 的语言矩阵存在缺口,坑 2 的文件级证据)。

siblings 文件清单全貌(共 66 项,归类):根目录 .gitattributes / README.md / ApolloCorpus.zip + assets 图 3 件 + check_exam 脚本 5 件(en/es/fr/zh 四语检查脚本 + questions/ 六语言题集 JSON:ar/en/es/fr/hi/zh)+ train/pretrain/ 22 件(11 组源-语言 × text/qa)+ train/question_dup.py + train/sft/ 33 件。预训练 11 组而非 13 组:qa 侧无 medicalGuideline_en_qa、medicalWiki_hi_qa 之外另有 1 组缺失(guideline 无 qa 对)——即 _text 13 splits、_qa 11 文件,两口径差 2。

SFT 33 件明细:code_en/code_zh(2)+ general_{ar,en,es,fr,hi,zh}(6)+ math_en/math_zh(2)+ medicalExam_{en,es,fr,zh} 各 4 变体(原始/_clean/_dup/dup_question,16)+ medicalPatient(3)+ 配套脚本若干。general 是唯一六语言齐全的 SFT 类,medicalPatient 三语言(ar/en/zh),math/code 双语(en/zh),medicalExam 四语(en/es/fr/zh)。

附录 N:论文 Tab.3 完整转录——21 模型 × 六语言分数全表

以下为论文 Tab.3 的完整一手转录(3-shot,正则抽取,百分比)。列序:EN=USMLE/MedMCQA/MMLU♢;ZH=MCMLE/CMMLU♢;FR=FrenchMedMCQA;ES=HEAD-QA;AR=MMLU♢;HI=MMLU♢;Avg。(♢ 为 MMLU 医学子集组合)

模型 USMLE MedMCQA MMLU MCMLE CMMLU FrenchMedMCQA HEAD-QA MMLU(AR) MMLU(HI) Avg
闭源
GPT-4 79.10 70.40 86.00 65.72 65.72 89.72 85.05 56.43 62.17 73.37
GPT-3.5 61.98 56.51 72.94 58.73 50.41 68.54 71.48 39.70 39.94 57.80
开源 >70B
Qwen-72B 64.10 62.16 78.46 91.68 81.47 74.14 76.62 46.87 43.16 68.74
Meditron-70B 55.70 50.87 69.59 48.34 40.29 53.27 59.74 19.30 31.31 47.60
Llama-2-70B 32.99 48.29 64.62 25.80 25.13 50.47 54.34 1.65 26.35 36.63
开源 7-34B
Qwen-14B 50.27 45.83 61.68 75.22 61.82 49.53 60.81 36.58 32.29 52.67
Yi-34B 62.45 60.60 71.86 26.12 26.51 66.04 69.99 30.70 9.73 47.00
开源 7B 级
Gemma-7B 53.42 50.94 70.15 48.95 43.29 57.63 62.79 36.21 48.58 52.44
MMedLM2-7B 55.46 50.49 68.15 64.30 56.11 58.57 62.14 23.53 24.15 51.45
Mistral-7B 47.29 47.38 62.80 38.32 34.21 50.78 51.93 28.40 27.36 43.16
Qwen-7B 32.36 39.52 53.22 54.32 44.71 37.69 45.05 28.31 24.89 40.01
Zephyr-7B-β 41.95 42.48 58.74 36.11 31.88 46.42 46.77 27.02 27.92 39.92
BioMistral-7B 41.79 42.05 54.46 34.65 31.43 43.61 44.66 27.11 22.96 38.08
Huatuo2-7B 37.86 36.58 42.49 55.08 43.81 27.41 33.88 25.92 27.46 36.72
Huatuo2-13B 29.77 36.58 42.86 56.07 45.46 22.42 36.13 18.29 13.59 33.46
Llama-2-7B 32.13 36.58 40.14 25.39 25.13 29.60 33.54 21.42 27.27 30.13
Meditron-7B 33.78 34.54 36.18 27.50 27.16 24.00 32.81 1.65 18.27 26.21
PMC-Llama-7B 20.11 23.12 19.72 16.90 16.73 17.13 18.68 9.65 2.85 16.10
本语料产物
Apollo-0.5B 32.99 37.82 45.87 56.57 42.08 27.41 36.67 31.89 25.90 37.47
Apollo-1.8B 42.18 44.99 49.12 72.30 53.56 38.01 42.15 34.74 25.62 44.74
Apollo-2B 38.33 42.00 52.89 46.76 36.76 38.32 41.28 31.62 31.50 39.94
Apollo-6B 56.25 57.53 68.65 85.52 72.62 51.71 58.47 33.46 33.61 57.54
Apollo-7B 56.00 58.21 71.86 72.36 59.04 60.44 63.73 41.82 45.55 58.78

全表可读出的四个结构信号(编辑部注):

  1. HI 列是"翻译基准照妖镜":基座家族的 HI 分数方差极大(Yi-34B 9.73 vs Gemma-7B 48.58)——同一翻译版 MMLU-HI 上,模型家族的印地语 tokenizer/预训练配比差异被放大;Apollo-7B 45.55 说明 Gemma 系底子被语料保住了。
  2. 医疗 SFT 不必然提升非英文分数:Huatuo2-13B(33.46)低于其同门 Huatuo2-7B(36.72)、Meditron-7B(26.21)低于 Llama-2-7B(30.13)——单语医疗微调可能损害低资源语言,反衬混合训练路线。
  3. HEAD-QA(ES)是最"便宜"的涨分点:多数 7B 模型在 HEAD-QA 上分数高于其英文 USMLE 分数(如 Gemma-7B 62.79 vs 53.42),Apollo 系亦然——西语侧竞争密度低。
  4. Apollo-0.5B 的 AR/HI(31.89/25.90)甚至超过若干 7B 模型——小模型 + 多语言混合语料在低资源语言上的性价比异常突出,与 §6.2 的"基座越弱增益越大"互证。

附录 O:语料内嵌题集与检查脚本(check_exam/,易被忽略的资产)

HF siblings 里有一组常被忽略的文件:check_exam/ 目录(5 件)。它们是团队自用的"考试题健康检查"工具链,对复现者有直接价值:

文件 内容 用途
check_exam/check_en.py 英文考试题检查脚本 校验 exams 分片格式/答案分布
check_exam/check_es.py 西语版 同上(ES)
check_exam/check_fr.py 法语版 同上(FR)
check_exam/check_zh.py 中文版 同上(ZH)
check_exam/questions/ar_question.json 阿语题集 六语言题集里唯一以 JSON 随库发布的 AR 侧数据——AR 预训练缺席(坑 2)背景下,这是 AR 在 pretrain/辅助文件层仅有的存在
check_exam/questions/{en,es,fr,hi,zh}_question.json 其余五语题集 与 XMedBench 组件对照用
train/question_dup.py 题干去重脚本 medicalExam_*_dup/_clean 变体文件的生成器(§12-Q4 的流程实证)

三个推论:① question_dup.py 的存在证实 medicalExam 的 _dup/_clean/_dup_question 三变体出自程序化去重(而非手工筛选);② 检查脚本只覆盖 en/es/fr/zh 四语——HI/AR 考试题没有专用检查器,与其"翻译基准"的从属地位一致;③ 想审计 exams 分片质量的复现者可直接跑这组脚本,不必重写。

附录 P:库内医疗 NLP/问答条目关系矩阵(ApolloCorpus 视角)

以本语料的"文本语料+考试题+对话"三视角扫描库内相关条目(url_name 与 rid 以 2026-09-28 只读查询为准;未列 rid 者为建议未来互链的潜在对象):

库内条目 类型 与 ApolloCorpus 的关系 联读价值
medmcqa(111) 考试题 XMedBench-EN 组件 训练/评测同源对照
headqa(120) 考试题 XMedBench-ES 组件 西语侧锚点
cmb-cmexam(180) 考试题 Exams-ZH 上游 + XMedBench-ZH 同源 泄漏检查案例
meddialog(210) 对话 Dialogues 分片同类 真实语体 vs 改写语体
pmc-oa(320) 文献 Papers-EN 同域 图文 vs 纯文本
s2orc(370) 文献 Papers 的量级参照 原料矿 vs 精炼料
mednli 推理 NLI 任务视角——语料 QA 对可改造为蕴含/中立/矛盾三元组 任务迁移
emrQA 问答 EHR 问答生成框架——语料 QA 对的另一种生产路径对照 问答生成方法论
MedQuAD 问答 真实患者问答(爬取)vs 本语料生成 QA 信任分层素材
medicationqa 问答 用药问答子域——general/medicalPatient 分片的子域透视 子域评测
healthsearchqa 问答 搜索query式患者提问 vs 论坛分片语体 medicalWeb 语体对照
pathvqa / slake / vqa-rad / omnimedvqa 多模态 VQA 本语料纯文本路线的对偶(影像问答) 模态光谱两端
rxqa 药学问答 药学子域——语料 papers/books 分片的药学密度评估 子域深耕
maccrobat / maccrobat 类标注集 标注 NLP 实体/关系标注 vs 本语料无标注预训练 AI-Ready 光谱对照
litilot/litcovid 等文献标注 文献标注 COVID 文献标注——papers 分片的时效子集对照 主题纵深

矩阵读法:本语料在库内"AI-Ready 光谱"上占据**“无标注/生成增强/多语言/预训练级”**的极端位置——与标注型条目(人工标签逐例可信)构成光谱两极,与考试题型条目(天然结构化)构成中间态。任何讨论"医疗数据 AI-Ready 程度"的条目都可以引本条目作端点样本。

附录 Q:九个月时间线纵深(2024.01-2024.10)

把 §2.2 的时间线按产品节奏重读一遍,能看到一个清晰的"三波发布"策略:

第一波(2024.01-02):占位。 repo 先行(01.23),语料与基准随后(README 口径 02.12)——先声明存在权,占住"多语言医疗 LLM"的叙事空位。此时论文未发、模型未挂,是典型的"先圈地后施工"。

第二波(2024.03):学术背书。 论文 v1(03.06)与 HF 数据集 repo(03.06 13:03 UTC)同日落场——注意 HF createdAt 精确到与 arXiv v1 同日,README 的 “02.12 published” 与 HF 实际创建时间的 22 天差,最合理的解释是"对外宣布日"与"仓库实际就绪日"之分(坑 7 的成因假说)。

第三波(2024.04-10):生态扩散。 MedJamba(04.25,架构嫁接)→ 数据集最后一次修改(09.13,修复性维护)→ 论文 v6(10.12,标题与作者定稿)→ ApolloMoE(10.15,50 语言叙事升级)。语料本体在 09.13 后冻结,团队重心转向 MoE——此后 ApolloCorpus 从"进行时"变成"完成时",成为后来者的静态参照物。

这九个月的节奏对数据集工程的启示:语料发布的"冻结点"宜选在下游生态(模型/基准/脚本)稳定之后——Apollo 团队把最后一次数据修改(09.13)放在 MedJamba 之后、ApolloMoE 之前,避免了"下游引用持续失效"的经典尴尬。

附录 R:六语言逐语对账卡

以下六卡按论文 Tab.2 + HF API 一手数字逐语言对账(CP=Continue Pretrain,IT=Instruction Tuning;占比按全语料 2,536.3M 计)。

R.1 英语 EN — 1,657.0M token(65.3%)

  • 对账:CP 1,392.3M(Books 296.7 + Papers 252.9 + Encyclopedias 221.1 + Web 499.9 + Dialogues 92.1 + Guidelines 29.6)+ IT 264.7M(Exams 42.1 + General 194.5 + Math 18.9 + Code 9.2)。
  • HF 文件:预训练五源全齐(paper_en 878k 行为全库最大分片),qa 侧缺 guideline_qa;SFT 五类全齐。
  • 质地:唯一六类俱全的语言;指南分片(29.6M)全球语料独此一份。
  • 使用建议:当作"主线语料"用;与其他语料(pmc-oa、s2orc)混用前先去重。
  • 坑位关联:坑 5(版权敏感分片集中在 EN)。

R.2 中文 ZH — 654.2M token(25.8%)

  • 对账:CP 538.6M(Books 117.1 + Papers 45.6 + Web 329.3 + Dialogues 46.6)+ IT 115.6M(Exams 35.3 + General 69.4 + Math 3.7 + Code 7.2)。
  • HF 文件:book/paper/web 的 text+qa 成对,dialogues 走 SFT patient_zh;无 wiki/guideline 分片。
  • 质地:Web 分片(329.3M)是 ZH 侧最大单项——论坛体质地;对话与考试直接继承 HuatuoGPT/CMB 资产,原生质量有背书。
  • 使用建议:与团队前作(HuatuoGPT 系)对照取用,避免重复导入同一批对话数据。
  • 坑位关联:与库内 cmb-cmexam(180) 联用注意同源去重。

R.3 西班牙语 ES — 122.4M token(4.8%)

  • 对账:CP 103.5M(Papers 46.0 + Web 57.5)+ IT 18.9M(Exams 0.5 + General 18.4)。
  • HF 文件:paper_es(89k 行)、web_es(153k 行)+ SFT 三件(general/exam/patient)。
  • 质地:无 book/wiki/guideline——ES 侧"预训练深度"有限,论文论文分片(46.0M)略超中文论文分片,是个反直觉细节。
  • 使用建议:六语言中"性价比第三"——有评测锚(HeadQA,Apollo-7B 得 63.73)与可用训练料,适合做西语医疗 LLM 的起点。
  • 坑位关联:headqa(120) 直接对标。

R.4 法语 FR — 29.2M token(1.2%)

  • 对账:CP 9.1M(Papers 4.5 + Encyclopedias 4.6)+ IT 20.1M(Exams 0.1 + General 20.0)。
  • HF 文件:paper_fr(8.28k 行)、wiki_fr(8.39k 行)+ SFT 三件。
  • 质地:预训练侧六语言最薄;pilot study 中 Apollo-French 单语训练(23.46)甚至低于基座(25.84)——法语料稀缺到"单语深训有害"的程度。
  • 使用建议:必须混合训练,勿单语续训;补料方向:FrenchMedMCQA 之外的法语医学开放语料。
  • 坑位关联:附录 H 的 Tab.1 法语行是"数据稀缺反噬"的引用源。

R.5 印地语 HI — 44.4M token(1.8%)

  • 对账:CP 0.5M(Encyclopedias 0.5,HF 仅 209 行)+ IT 43.9M(General 43.9)。
  • HF 文件:wiki_hi(209 行,全库最小分片)+ general_hi + 无 patient/exam/math/code。
  • 质地:预训练几乎为零、SFT 全靠 general 顶——"预训练 0.5M + 指令 43.9M"的倒挂结构是六语言中独一份。
  • 使用建议:只做指令微调目标语言;预训练靠混合语料的迁移效应(附录 H:混合训练使 HI 从 8.82 大幅受益)。
  • 坑位关联:坑 4(README 的 HI 评测链接指向阿语集)。

R.6 阿拉伯语 AR — 29.1M token(1.1%)

  • 对账:CP 10.4M(Dialogues 10.4——论文有账、HF 无文件)+ IT 18.7M(General)+ patient(未计入 Tab.2 的 IT 拆列)。
  • HF 文件:仅 general_ar + medicalPatient_ar;check_exam/questions/ar_question.json 是 AR 在辅助文件层唯一存在(附录 O)。
  • 质地:对话源自 MAQA 真实问答(>128 字符过滤),质量上限高但量小;预训练实物缺席是六语言中唯一。
  • 使用建议:补课清单——从 MAQA 拉原始文本自建 AR 预训练分片;评测用 MMLU_Ara(翻译版,原生性弱)。
  • 坑位关联:坑 2 的主角;坑 4 另一头。

R.7 六卡总览

语言 总 token 占比 CP/IT 结构 HF 预训练分片 一句话评级
EN 1,657.0M 65.3% 1392.3/264.7 五源全齐 主线,几乎无短板
ZH 654.2M 25.8% 538.6/115.6 四源(缺 wiki/guideline) 强,借力团队前作
ES 122.4M 4.8% 103.5/18.9 paper+web 够用,有评测锚
HI 44.4M 1.8% 0.5/43.9 wiki 209 行 结构倒挂,纯指令依赖
FR 29.2M 1.2% 9.1/20.1 paper+wiki 最薄,单语训练有害
AR 29.1M 1.1% 10.4/18.7 无(论文有账) 宣传与实物落差最大

附录 S:外部抓取存照(核验流水账,2026-09-28)

本条目全部事实的取证记录,按抓取动作逐一存照(工具、URL、结果),供复核者重放:

# 动作 对象 结果
S1 WebSearch FreedomIntelligence ApolloCorpus 数据集 命中 HF 页面快照:3,741,196 rows / 22.3 GB / downloads 1,529 / likes 41 / pretrain_text 13 splits 行数分布 / 数据卡"Covering English, Chinese, French, Hindi, Spanish, Hindi, Arabic"原文
S2 WebFetch arXiv abs 页 12 作者、v1-v6 日期链、DOI、摘要全文、“Comments: Preprint”
S3 WebFetch hf-mirror.com 数据集页 被重定向提示页拦截(跳回原站)→ 改走 API(S5)
S4 WebFetch arXiv HTML v6 / v4 / ar5iv 三次均返回空内容 → 改 curl(S6)
S5 WebFetch hf-mirror.com/api/datasets/FreedomIntelligence/ApolloCorpus 一手 JSON 全字段:license apache-2.0、usedStorage 39,147,380,685 B、createdAt、lastModified、13 splits data_files、66 项 siblings ✓
S6 curl -A UA arxiv.org/html/2403.03640v6 270,362 字节 HTML 落地 /tmp,python 解析出:2.5B tokens 原句、Tab.2 token 账本、Tab.3 完整 21 模型表、Tab.4 消融、π=16/2、batch 256/lr 1e-5、36,107 词条、MAQA/HuatuoGPT/PMC-Patients 溯源、6.1B 人口脚注 ✓
S7 WebFetch github.com/FreedomIntelligence/Apollo README 全文:时间线五事件、usage format 双模板、XMedBench 清单(HI/AR 链接互换存照)、GGUF 致谢、BibTeX ✓
S8 WebFetch apollo.llmzoo.com fetch failed(T1 存照,主页未直核)
S9 WebSearch 论文 token 数 + 基座 Lacuna/Tiptree 与 BearPlex 二手转述:2.5B token(与 S6 一致)、“Qwen backbone”(与 S6 Tab.3 冲突→坑 7)、proxy-tuning ≈3 分(转述口径)
S10 hf-mirror API /papers/2403.03640 重定向提示页拦截,未取到(无关键损失,S6 已覆盖)
S11 bash scripts/qf_psql.sh SELECT record_id,url_name,status FROM ai_ready_dataset WHERE url_name ILIKE '%apollo%' (0 rows)——库内无 apollo 条目 ✓
S12 bash scripts/qf_psql.sh IN 查询候选互链条目 medmcqa 111 / headqa 120 / cmb-cmexam 180 / meddialog 210 / pmc-oa 320 / s2orc 370 / panda-plus 640 ✓
S13 ls writing/ 全库条目目录清单 无同名目录;确认互链候选存在性 ✓
S14 HF 页面快照 viewer pretrain_text/medicalWeb_zh?p=312 样本实拍:癌症食欲不振机制长文,text 长度 32-34.7k 字符 ✓

环境备忘:HuggingFace 主站与 apollo.llmzoo.com 在本沙箱不可直连(S3/S8/S10 三次失败);hf-mirror.com 的 API 路径与 arXiv 直连稳定可用;GitHub 页面直连正常。

附录 T:检索 query 与命中对照(给后来者的搜索地图)

为"下一版修订者"与同主题检索者存的 query-命中对照(均 2026-09-28 实测):

检索意图 推荐 query 命中质量
数据集本体规模 FreedomIntelligence ApolloCorpus rows size 优——HF 页面快照直接给出 rows/GB
论文与模型系 Apollo 2403.03640 multilingual medical LLM 优——abs 页 + 多个镜像解读
token 规模 ApolloCorpora 2.5B tokens medical 良——需进 HTML 全文核原句
基座构成 Apollo 7B base model Gemma Qwen Yi 中——二手多误传"Qwen backbone",必须回 Tab.3
阿拉伯语数据 ApolloCorpus Arabic MAQA medicalPatient 中——HF 文件树是唯一权威,搜索少有直达
XMedBench 组件 XMedBench MMLU_HI MMLU_Ara FrenchMedMCQA 良——GitHub README + 论文 §4.1
引用条目 wang2024apollo bibtex 优——README 原文(注意坑 6 少两人)
中文语境 阿波罗 医疗大模型 多语言 港中深 弱——中文报道稀少,建议直接读英文一手

检索纪律三条:① 任何"规模/语言/基座"结论必须落到 S5(HF API)或 S6(论文 HTML)两个一手源之一;② 二手转述(S9 类)只允许用于存照,不得直接进正文硬数字;③ HF 主站不可达时一律换 hf-mirror.com 同路径,不要降级为纯搜索快照。

附录 U:术语中英对照与首现速查

正文以中文为主、术语首现标英文;本表汇总全部关键术语的中英对照与正文首现位置(§ 号),供翻译、审校与跨条目引用对齐:

中文术语 英文原文 首现 备注
继续预训练 continued pre-training (CP) §0 本语料主用途;与"从头预训练"区分
指令微调 supervised fine-tuning (SFT) §0 训练阶段二;HF 的 train/sft/ 目录名即此
问答增强预训练 QA-Augmented Pre-training §0 论文核心方法一;_qa 文件的来源
混合训练 Mix Training §0 论文核心方法二
优先采样 priority sampling §4.3 公式 P_t(x)=π(x)/Σπ(y);π=16/2
代理微调 proxy-tuning §0 论文核心方法三;logit 偏移法
多语言医疗大语言模型 multilingual medical LLM 导语 项目总定位
医学多选题问答 medical multiple-choice question answering (MCQA) §6 XMedBench 全部组件的任务形态
基座模型 base / backbone model §6.2 Tab.3 的配对左列;忌译为"骨干网络"(那是 CNN 语境)
数据泄漏检查 data leakage checking §4.4 论文 §3.1 专节名
文本与数据挖掘 text and data mining (TDM) 坑 5 版权例外条款的通行缩写
医患对话 doctor-patient dialogues §3.2 Dialogues 分片;HF 侧名为 medicalPatient
低资源语言 low-resource languages §0 HI/AR/FR 在本语料语境下的实际地位
翻译基准 translated benchmark §6.1 MMLU_HI/MMLU_Ara 的生成方式;与"本源基准"相对
本源基准 native benchmark §6.1 HeadQA、FrenchMedMCQA、MedQA 系等
冻结发布 frozen release §5.4 2024-09-13 后不再修改的状态
生成文本层 model-generated text layer §13.2 编辑部治理分级术语(非论文原词)
信任梯度 trust gradient 附录 J 编辑部定性评级术语(非论文原词)
AI-Ready 光谱 AI-Ready spectrum §11.2 库内条目体系的通行分析框架
归一化 token 账本 token ledger §3.2 指论文 Tab.2 的分语言分来源统计

翻译与引用提示:论文标题中的 “Lightweight” 官方中文语境常译"轻量级";“Democratizing Medical AI to 6B People” 建议译"让医疗 AI 惠及 60 亿人"(数字指语言覆盖人口,见 §2.3);“ApolloCorpora” 在中文行文里建议保留原文不译,避免与希腊神话"阿波罗"混淆。

表内"首现"列为 § 编号(附录内容以附录字母标记)。审校时若增删术语,请同步更新本表行序——本表按正文出现顺序排列,是全条目术语的单一事实源(single source of truth);跨条目引用时以本表译名为准,避免同库异译。

(附录 U 完)

附记:成稿过程存照(并发写入事故与处置)

本条目成稿期间发生一次**/tmp 临时文件池并发写入冲突**,按库内存照文化如实记录全程与处置:

  1. 现象:agent-a-apollocorp 按 §0 三查约定以 /tmp/apollocorpus_agent-a-apollocorp_part*.md 唯一化命名直写 part1-12;23:56 第一次拼接(841 行)后继续追加 part13-16 时,发现 part2/3/4/5 已被另一进程以另一章节体系(“§2 数据构成与规格”“§10 检索与使用坑位:九则”"附录 E:扩展问答(11-30 问)"等,合计多出约 200 行异源内容)覆盖;时间戳交叉显示双方在 23:50-23:58 窗口内互相覆写(对方 part6/7/8 写入时间甚至早于本代理 part4)。锁文件 writing/apollocorpus/.lock(本代理名,23:33 建立)全程未被对方尊重或检查。
  2. 危害评估:若未发现,成稿将是两个代理产物的混合体(1187 行的中间版实际混入了异源章节,章节序号 §14/§15 与 §16 错序)。
  3. 处置:① 弃用 /tmp 共享池,改在本代理锁保护目录内建私有 part 区(writing/apollocorpus/.parts_agent-a-apollocorp/);② 逐文件以特征串鉴别归属(INFOBOX/BibTeX 坑 6/13.5 节等特征句),确认 part1/6/9/10/11/12 为本代理原文后拷入私有区;③ part2/3/4/5/7/8 按本代理上下文中的原文全量重写;④ 重拼并逐节核对章节序(§0-§15 + 附录 A-U + 参考资料 + 编辑记录,无一错序);⑤ 事故过程写入本附记与编辑记录。
  4. 建议:/tmp part 唯一化约定在"同名代理多实例"场景下不设防——建议后续任务头的三查条款增加一条:part 文件直写工作目录锁内私有区,/tmp 仅作一次性中转或彻底不用;拼接前增加"章节序完整性校验"步骤。
  5. 责任声明:本附记仅记录现象与处置;对方进程身份不明(ps 快照仅见 3 个 --prewarm 预热进程与当前会话 shell),不做归因推断。

参考资料

  1. Wang, X., Chen, N., Chen, J., et al. Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People. arXiv:2403.03640 (v1 2024-03-06, v6 2024-10-12). https://arxiv.org/abs/2403.03640
  2. FreedomIntelligence. ApolloCorpus dataset card. HuggingFace. https://huggingface.co/datasets/FreedomIntelligence/ApolloCorpus (API: /api/datasets/FreedomIntelligence/ApolloCorpus,抓取 2026-09-28)
  3. FreedomIntelligence. Apollo GitHub repository(README 时间线、usage format、XMedBench 清单). https://github.com/FreedomIntelligence/Apollo
  4. FreedomIntelligence. XMedBench dataset. https://huggingface.co/datasets/FreedomIntelligence/XMedbench
  5. 论文 HTML 全文(v6):https://arxiv.org/html/2403.03640v6 (Tab.2 token 账本、Tab.3 基座配对、Tab.4 消融、Fig.5 改写 prompt)
  6. 项目主页(Demo):https://apollo.llmzoo.com/ (本次抓取失败,存照 T1)
  7. GGUF 量化版致谢 mradermacher:https://huggingface.co/FreedomIntelligence/Apollo-7B-GGUF
  8. 第三方转述(仅存照用):Lacuna/Tiptree Systems 论文解读页;BearPlex Apollo 技术评述页
  9. Google Scholar 引用页(被引 71,2026-09-28 快照);arxiv.gg(Cited by 19)

编辑记录

日期 动作
2026-09-28 agent-a-apollocorp 初稿成文:三查(锁/唯一化/ps=5)→ 三源核验(arXiv abs+HTML v6 / HF API via hf-mirror / GitHub README;apollo.llmzoo.com 抓取失败存照)→ DB 查重 0 命中 → FACTS.md 九节 → 成稿分 9 part 拼接 → 双检自证
2026-09-28 核验员候选信息(3,741,196 行 / 22.3 GB / Apache-2.0 / 六语言 / arXiv:2403.03640)全部经一手复核;其中"六语言"按坑 2 细化为"预训练五语言 + SFT 六语言"

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mediqa — 共享标签:医疗NLP / 临床文本 / 生物医学文献 / 评测基准
  • ehrsql — 共享标签:医疗NLP / 临床文本 / 医学问答 / 评测基准
  • xmedbench — 共享标签:医学问答 / 医学考试 / 评测基准
  • cord-19 — 共享标签:医疗NLP / 生物医学文献 / 医学问答
  • meddialog — 共享标签:医疗NLP / 临床文本 / 医学问答
  • pubmedqa — 共享标签:医疗NLP / 生物医学文献 / 医学问答 / 评测基准
  • medqa — 共享标签:医疗NLP / 医学问答 / 医学考试 / 评测基准
  • medmcqa — 共享标签:医疗NLP / 医学问答 / 医学考试 / 评测基准
  • cmb-cmexam — 共享标签:医疗NLP / 医学问答 / 医学考试 / 评测基准
  • medcalc-bench — 共享标签:医疗NLP / 临床文本 / 医学问答 / 评测基准

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集