BIOMEDICA — 生物医学图文档案 AI-Ready Wikipedia

24,076,288 图-注对 · 6,042,494 篇 PMC 开放获取文献 · 27 元数据字段 · WebDataset 流式 · BMC 模型家族

来源 Stanford University(主导,18/19 作者)+ Mayo Clinic(Chia-Chun Chiang);合作 Hugging Face url: https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M发布时间: 2026-09-30最后更新: 2026-09-30 阅读 9
BIOMEDICA — 生物医学图文档案 AI-Ready Wikipedia

信息速览

数据集名称BIOMEDICA — 生物医学图文档案 AI-Ready Wikipedia
数据类型影像数据,文本数据,WebDataset,流式加载,多模态对齐,自动标注
规模未报告(源自已发表开放获取文献,患者层面个体信息不可识别;文章级计数 6,042,494)
接入方式Stanford University(主导,18/19 作者)+ Mayo Clinic(Chia-Chun Chiang);合作 Hugging Face url: https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M
AI 就绪度

BIOMEDICA — 生物医学图文档案 AI-Ready Wikipedia


INFOBOX

数据集名称 BIOMEDICA
英文全称 BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
别名/简称 BIOMEDICA(HF org 同名);主库 BIOMEDICA/biomedica_webdataset_24M;勿与 Microsoft 的 BiomedCLIP/PMC-15M、ROCO 混淆(见 §2.3、§9.2)
疾病分类 全医学与生命科学谱系(源自 PMC 开放获取文献,无统一 ICD 归类;图像级按 12 global / 170 local concept 分类,见 §2.1)
SNOMED CT 不适用(语料级数据集,非单一疾病;按 concept taxonomy 组织)
数据模态 生物医学图像(显微镜、临床影像、图表、示意图、化学结构等)+ 英文图注文本 + 图-正文行内引用 + 文章级元数据
AI 任务类型 视觉-语言对比预训练(CLIP 式)、图像-文本检索、图像分类、VQA、检索增强生成(RAG)、科学文献图-文对齐研究
样本总数 24,076,288 个唯一图像-图注对;30,711,542 条图-正文行内引用;6,042,494 篇文章(5,050,473 含图 + 992,021 纯文本)
数据大小 HF 标签 size_categories n>1T;收集阶段占存储 30TB,HF 体量约 27TB;训练靠 streaming 免下载
数据格式 WebDataset(tar 分片,每片 10,000 对);评测集与 BioMedFlickr 为 Parquet
许可证 无单一统一许可:逐条沿承 PMC-OA 源文章 CC 许可,分三组(Commercial allowed / Non-commercial only / Other);主库 gated:auto
访问级别 申请(HuggingFace gated:auto:勾选数据使用协议 + 填写用途;评测集与子集 gated:false)
DUO 标签 按许可分组承载(商业可用组近似 DUO 开放;非商业组近似 NPUNCU 非商业非营利;other 组需逐条核查)
语言 图注与元数据为英文(源自英文开放获取文献)
首发日期 2025-01-13(arXiv:2501.07171 v1);扩展版 2025-03-26(arXiv:2503.22727)
最后更新 arXiv:2503.22727 v3 更新 2026-09-16;HF 主库 lastModified 2026-09-02
发布机构 Stanford University(主导,18/19 作者)× Mayo Clinic(Chia-Chun Chiang);Hugging Face 托管
官方主页 https://minwoosun.github.io/biomedica-website(HF README 给出的官网;GitHub Pages,沙箱不可达)
下载地址 https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M(gated:auto);国内可走 hf-mirror.com 镜像(授权仍在 HF 侧完成)
DOI 10.1109/CVPR52734.2025.01837(CVPR 2025 正式版);预印本 10.48550/arXiv.2501.07171 / 10.48550/arXiv.2503.22727
引用次数 精确计数以 Google Scholar 页面为准(截至 2026-09 查询时点未采信具体数字;CVPR 2025 正式发表后引用仍在增长)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 27 元数据字段 + 专家层级标注 + WebDataset 流式 + 双论文文档完备;扣分项:gated 申请、无单一统一许可(三组逐条)、图像类型高度不均衡(真影像仅约 17%)、标注为聚类传播而非逐图人工
页面状态 published

导语读法三则:

  1. 只想下数据:直奔 §6.2 获取流程——注意这里是 streaming 优先的 27TB 库(gated:auto 勾协议即得),不要试图整库下载;先按许可分组(commercial / non-commercial / other)决定取哪一片,再按 global concept 过滤掉图表类。
  2. 关心规模与口径:直奔坑 1("over 24M"约数 vs 24,076,288 精确值)与附录 I 多口径登记表——论文附录、README、v1/v3 之间存在多处数字分叉,引用前先看口径。
  3. 做测评/选上游:先读 §7.2 与 §9——BIOMEDICA 是 rex-in-the-wild 的直接上游图文源(32,982 张采样自其 non-commercial + Natural Images 切片),也是 open-pmc 论文明引的 prior work;与库内 pmc-oa(320)/pmc-oa-subset(360) 同源 PMC-OA 但不同数据集。

§0 E-E-A-T 信任声明与免责声明

审核声明:本条目由千方病案医数集编辑部于 2026-09-30 基于一手来源撰写与审核。核心事实经三源互证:① arXiv 论文全文(2501.07171、2503.22727,API 实测标题与版本日期 2026-09-30);② IEEE/CVF CVPR 2025 会议出版记录(Crossref API 实测 DOI 10.1109/CVPR52734.2025.01837、页码 19724-19735);③ HuggingFace 组织 BIOMEDICA 数据与模型仓库元数据(经 hf-mirror.com 镜像 API 实测:主库下载数、gated 状态、size_categories、评测集与 BioMedFlickr 的样本数与字节数)。所有关键数字在正文标注出处;文档之间的数字冲突不在正文中强行统一,而是在坑点与附录 I 逐条存照。

医学免责声明:本条目为数据集技术文档,不构成临床建议。BIOMEDICA 是从已发表开放获取文献中抽取的图像-图注档案,其图像与文本反映原文献的研究语境,标签体系(global/local concept)描述的是图像类型而非诊断结论。任何基于本数据集训练或评测的模型输出均不得直接用于临床诊断决策。使用时须逐条遵守源文章的 CC 许可要求。

数据免责声明:本条目所述数据以发布时点的官方仓库状态为准(抓取时点 2026-09-30)。HuggingFace 数据卡与两版论文之间存在多处数字口径差异(元数据字段数、global concepts 数、标注者数、Plots and Charts 计数、任务数),本条目以"论文附录统计表口径"为主口径、"README/v1/v3 口径"并列存照,检索者引用任何数字前应先核对附录 I 的口径登记表。主库为 gated:auto,撰写时点无法直接抽样原文验证字段结构,字段字典据论文与 README 转写。

AI 参与声明:本条目由 AI 辅助起草并经人工校验(详见 §10 AI 使用声明卡)。

§1 数据集概览

§1.0 30 秒速览

BIOMEDICA 把 PubMed Central 开放获取(PMC-OA)文献里"每一张图 + 它下面那段图注"成对抽出、清洗、打标,攒成一个 2,400 万对的超大规模生物医学图-文档案。它的目标不是采集新数据,而是把已经公开发表、已经有图注写的科学图像变成可直接喂给 CLIP 式视觉-语言模型训练的高质量语料——用论文自己的话说,是让生物医学多模态模型拥有属于本领域的"图文预训练底座"。

三句话抓住它:

  1. 规模:24,076,288 图-注对、30,711,542 条图-正文引用、6,042,494 篇文章、27 个元数据字段——比库内同源的 pmc-oa(320)(约 164 万对)大约 14.6 倍,是目前公开的最大规模生物医学图文配对档案之一。
  2. 方法:专家引导的标注流水线(DINOv2 嵌入 + PCA + K-means 过聚类 + 7 名专家每簇抽 30 张 + 多数投票 + 簇传播),宣称用 24 标注小时给 2,400 万张图打上 12 global / 170 local concept 标签。
  3. 衍生:由它训练出 BMC-CLIP、BMC-SmolVLM(256M/500M/2.2B)、BMC-LongCLIP 模型家族与 BMC-agent 检索增强助手;并在 35-40 项零样本分类、BioMed-Flickr 检索、VQA 与指南问答上评测。

一句话定性:BIOMEDICA 是一个"科学文献 ETL 框架 + 超大规模图文语料 + 自研模型家族"三件套,数据集本体真实存在且可流式获取,判定为可立项的 AI-Ready 数据集(非纯框架)。

档位判定的关键证据:HF 组织 BIOMEDICA 下实存 10 个数据 repo(主库 + 4 类预滤子集 × webdataset/parquet + 评测集 + BioMedFlickr),主库 biomedica_webdataset_24M 有 2,885 次下载、40 likes、size n>1T,且支持 WebDataset 流式加载——数据实体可验证,不受"论文自称 framework"措辞影响。

§1.1 技术摘要

维度 内容
全称 BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
团队 Stanford University(主导,18/19 作者)+ Mayo Clinic(Chia-Chun Chiang);通讯 Alejandro Lozano / Min Woo Sun / Serena Yeung-Levy
首发 arXiv:2501.07171(2025-01-13,cs.CV + cs.CL)
扩展版 arXiv:2503.22727(v1 2025-03-26 / v2 2025-04-01 / v3 2026-09-16,cs.CL + cs.LG,19 作者)
正式发表 IEEE/CVF CVPR 2025,pp.19724-19735,Nashville 2025-06-11~15,DOI 10.1109/CVPR52734.2025.01837
核心规模 24,076,288 图-注对;6,042,494 文章;30,711,542 图引用;27 元数据字段;12 global / 170 local concepts
数据格式 WebDataset tar(10,000 对/片),按 commercial / non-commercial / other 三组许可分区
模型家族 BMC-CLIP、BMC-SmolVLM(256M/500M/2.2B)、BMC-LongCLIP、BMC-agent
获取 HF org BIOMEDICA;主库 gated:auto;评测集/子集 gated:false
许可 无单一统一许可,逐条沿承 PMC-OA 源文章 CC 许可,分三组
代码 github.com/minwoosun/biomedica-etl(ETL);github.com/Ale9806/open_clip_with_biomedica(CLIP 训练)

§1.2 战略价值

  • 对生物医学多模态:在 BIOMEDICA 之前,公开的医学图文配对语料要么规模偏小(ROCO 约 8 万放射图、Quilt-1M 约百万级),要么局限于特定模态(PMC-15M 偏临床影像)。BIOMEDICA 以"PMC-OA 全量 + 不限影像类型 + 专家层级标注"补齐了"领域级图文预训练底座"这一格。
  • 对科学文献挖掘:它把"文献图-文抽取"从一次性研究变成一个可复用的 ETL 框架(biomedica-etl)与可增量更新的数据管线,为后续任何"文献→多模态语料"的工程提供模板。
  • 对评测生态:配套的 BioMed-Flickr 检索基准与 Biomedica2025EvalSet(8 大评测套件,89,941 题)让"用文献语料训练的模型该在哪评"有了统一出口;BMC-agent 的 RAG 协议(沿 clinfo.ai)又把语料接入了临床问答场景。
  • 对数据工程方法论:24M 图像仅用 24 标注小时,是"嵌入聚类 + 专家抽标 + 传播"这一范式在超大规模下的公开实证,对任何"标注预算有限但语料巨大"的团队都有直接参考价值。

§1.3 同类数据集横向对比

数据集 图像-图注对规模 图像范围 来源 标注 许可
BIOMEDICA(本条目) 24,076,288 全类型(图表为主,真影像约 17%) PMC-OA 专家层级分类(12/170 concepts) 逐条 CC,三组
BiomedCLIP / PMC-15M 约 15,000,000 临床影像为主 PMC 无专家分类 学术
open-pmc(Open-PMC-18M) 约 18,000,000 子图-caption,重子图抽取保真 PMC-OA 无专家分类 学术
pmc-oa / PMC-CLIP 1,646,592 子图级 PMC 无专家分类 CC 混合
ROCO 约 82,000(放射图) 放射影像(自 6,031,814 对筛出) PMC-OA 人工筛放射 公开
Quilt-1M 约 1,000,000 病理 多源(YouTube 等) 无 多样

读表要点:BIOMEDICA 的差异化不在"影像质量更高"(恰恰相反,它 51% 以上是图表),而在全量覆盖 + 元数据字段 + 专家分类 + 流式交付。做医学影像任务要先按 concept 过滤;做文献图-文对齐/规模定律才是它的主场。

§1.4 版本时间轴

时间 事件
2024-07-02 ~ 09-20 NCBI FTP 批量下载 PMC-OA 子集,历时 81 天,占 30TB 存储
2025-01-13 arXiv:2501.07171 v1 发布(“scalable, open-source framework” 口径,附录统计表基准)
2025-03-26 扩展论文 arXiv:2503.22727 v1 发布(“A Large-Scale Vision-Language Dataset…”)
2025-04-01 两篇论文同日更新:2501.07171 v3、2503.22727 v2
2025-06-11~15 CVPR 2025(Nashville)展示,poster 编号 33761
2025-06-10 CVPR 2025 论文集出版(DOI 10.1109/CVPR52734.2025.01837)
2026-08-20 Biomedica2025EvalSet 更新(lastModified,gated:false)
2026-09-02 HF 主库与 BioMedFlickr lastModified
2026-09-16 arXiv:2503.22727 v3 更新(扩展版最新)

§1.5 典型应用场景

  1. CLIP 式对比预训练:用 24M 图-注对对 OpenCLIP ViT-L-14 等底座做领域连续预训练(BMC-CLIP 即此路线,10× less compute 于同类)。
  2. 医学图-文检索:构建文献图检索、以文搜图、以图搜文系统;BioMed-Flickr 可作为检索评测。
  3. VLM 指令微调语料:BMC-SmolVLM 用小规模指令(10K)即达可比性能,适合资源受限团队。
  4. 检索增强生成(RAG)医学问答:BIOMEDICA Index(向量 + BM25 混合索引)支撑 BMC-agent 类临床助手。
  5. 科学文献图-文对齐研究:研究图表在文献中的分布、图文语义对齐、规模定律。
  6. 零样本分类评测:Biomedica2025EvalSet 的 8 大套件提供跨模态、跨器官的评测出口。

§2 医学背景与数据构成

§2.1 分类法:12 global / 170 local concepts

BIOMEDICA 的组织轴不是器官或疾病,而是图像类型(concept)。团队用一套自底向上归纳的层级分类法给图像打标:

  • Global concepts(第一层):12 类(正文口径)——Clinical Imaging、Microscopy、Plots and Charts、Immuno Assays、Illustrative Diagrams、Scientific Formulae and Equations、Tables、Hand Drawn and Screen Based Visuals、Graph and Network、Chemical Structures、Maps、Tools and Materials、PCR(注:正文枚举见 §3.5,附录另有 Natural Images 行,附录统计表写 13,见坑 3)。
  • Local concepts(第二层):170 类,颗粒度更细。其中 Plots and Charts 的子类最粗(96 个 local concept),Clinical Imaging 有 34 个 local(MRI/CT/ultrasound 等)。

标签如何产生(专家引导流水线):DINOv2(ViT-L-14 distilled)图像嵌入 → PCA 降到 25 主成分 → K-means 过聚类 K=2000 → 7 名标注者(clinicians + scientists)每 cluster 抽 30 张 → 按层级分类法打 global + local concept(可多标签)→ 多数投票定标签(平票重评)→ 按 cluster ID 用 hash map 传播到该簇全部图像。

这决定了你的用法:标签是"聚类级"而非"逐图级"。同一 cluster 内所有图像共享由 30 张样本投票得出的标签——高效但存在传播误差。若你的任务对单图标签精度敏感,务必在自己的子集上复标校准。

标签覆盖率:分类法覆盖 23,271,916 张图,占 24M 的 96.7%。

§2.2 图像类型分布(Table 16 口径)

按 global concept 统计图像数(Commercial / Non-commercial / Other / 合计):

global concept Commercial Non-commercial Other 合计
Plots and Charts 542,718 9,426,147 2,394,358 12,389,066
Illustrative Diagrams 140,925 2,227,690 551,380 2,919,995
Microscopy 101,617 1,818,302 597,413 2,517,332
Clinical Imaging 82,349 1,078,901 766,908 1,928,158
Chemical Structures 92,881 839,082 196,119 1,128,082
Immuno Assays 38,055 651,339 215,238 904,632
Tables 26,190 269,384 343,455 639,029
Maps 18,700 264,092 41,473 324,265
Tools and Materials 10,320 210,740 51,339 272,399
PCR 2,307 25,353 7,693 35,353
Equations 2,322 20,384 6,182 28,888

关键观察:

  1. 真影像只占少数:Microscopy(2,517,332)+ Clinical Imaging(1,928,158)合计 4,445,490,占 24M 的约 17%(论文口径 “Biomedical(microscopy + clinical imaging)仅占 17%”)。其余八成以上是图表、示意图、结构式、表格等。
  2. 商业可用子集极稀:Commercial 列各项合计远小于非商业,且真影像在非商业类文章中占比更高(13% vs 商业 5% / other 6%)——意味着"想商用"与"想要真影像"两个诉求在 BIOMEDICA 里互相拉扯,商业可用切片里临床影像尤其稀缺。
  3. Plots and Charts 是绝对多数:12,389,066 张,约 51.5%(论文正文另有 “over 13 million / 57%” 的表述,表文不一,见坑 3)。
名称 关系 关键区分点
BIOMEDICA(本条目) 本体 24M 全量、全类型、专家分类、27 字段、WebDataset 流式、Stanford
BiomedCLIP(Microsoft) 无直接血缘,常被检索混淆 微软出品;PMC-15M,约 15M 对,偏临床影像;命名与 BIOMEDICA 不同但均含 “BioMed”
ROCO(Pelka 2018) 同源 PMC-OA,非同数据集 ROCO 起始于 PMC-OA 的 6,031,814 图-注对,筛出约 82K 放射图;BIOMEDICA 是全量 24M;库内 ROCO 为独立条目
pmc-oa / PMC-CLIP(320) 同源 PMC,不同团队/论文/规模 1,646,592 子图级对(Zhang et al. arXiv:2303.07240);BIOMEDICA 为其约 14.6 倍;见 §9.2
open-pmc(45) / Open-PMC-18M 同源 PMC-OA,对比关系 18M 子图-caption 对(Vector Institute/York U,MICCAI 2026);其论文明引 BIOMEDICA 为 prior work;重 subfigure extraction 保真对齐
rex-in-the-wild BIOMEDICA 的下游 其 32,982 张采样图像取自 BIOMEDICA 的 “non-commercial + Natural Images” 切片;BIOMEDICA 是其直接上游图文源;见 §9.3

§2.4 文本与图像规格

维度 数据
图注 tokens 总量 2.84 × 10⁹ tokens(单条 1 ~ 12,389 tokens,中位 64)
全文 tokens 总量 6.65 × 10¹⁰ tokens
图-正文行内引用 30,711,542 条(单条最长 699,117 tokens,中位 338)
每篇文章平均 4.9 张图;每图 1.6 条图-正文引用
图像尺寸 中位宽 709 × 高 476 px;最大宽 52,490 × 高 65,081 px(跨缩略图至整页大图)
图像总类数 24,076,288 对 / 6,042,494 文章

规格隐含的工程载荷:图注 token 分布极长尾(中位 64 但最长逾 1.2 万),全文 token 达 6.65×10¹⁰,直接全量文本训练需要分块与截断策略;图像尺寸跨度从缩略图到 5 万像素级整页大图,预处理须统一缩放管线(BMC-CLIP 沿用 OpenCLIP 惯例的固定分辨率)。

§2.5 文章与许可构成

  • 文章总数:6,042,494(含图文章 5,050,473 + 纯文本文章 992,021)。
  • 许可分布(v1 Table 17):
许可 文章数 分组(PMC 口径)
CC BY 3,795,419 Commercial allowed
CC BY-NC 771,755 Non-commercial only
CC BY-NC-ND 642,982 Non-commercial only
Other 414,857 Other
CC0 132,592 Commercial allowed
CC BY-NC-SA 275,638 Non-commercial only
CC BY-ND 7,900 Commercial allowed
CC BY-SA 1,287 Commercial allowed

商用可行性的真相:粗略看,商业可用(CC0 + CC BY + CC BY-SA + CC BY-ND)合计约 3,937,198 篇,占约 65%;但真影像在非商业文章中占比更高,所以"商用 + 真影像 + 足量"这个交集远小于表面数字。做商业产品前请务必在 commercial 分区内实测你的目标 concept 的可用样本量。

§2.6 文献图文抽取的工程背景

要理解 BIOMEDICA 为什么值得做、难在哪,得先看"把科学文献变成图文语料"这件事的三重工程难度:

第一重:解析难。 PMC 文章以 JATS XML 形式提供,图像与其图注通过 <fig> 元素关联,但真实文献里这张关联并不规整——有的图注只有一句话,有的长达一万多 token(BIOMEDICA 实测图注最长 12,389 tokens);有的一篇文章几十张图,图与正文的引用关系散落在 Methods、Results、Discussion 各处。BIOMEDICA 抽取出的 30,711,542 条 figure reference(每图平均 1.6 条)正是这一层"图—正文"桥的量化产物,也是它相较只抽"图 + 图注"的数据集(如早期 ROCO)多出来的语境信息。

第二重:分类难。 一旦语料是全量的,图像类型就会极其杂:研究论文里既有显微镜照片、临床影像,也有折线图、示意图、化学结构式、表格、地图、器材照片。不做分类,语料就无法按下游任务取用。但给 2,400 万张图人工分类不现实——这正是 BIOMEDICA 引入专家引导聚类标注(§3.6)的动因:先用 DINOv2 把"看起来像"的图聚到一起,再让专家只判断每簇的 30 张代表。这套方法论的代价与价值:代价是标签是聚类级的、有传播误差;价值是让"全量分类"第一次在 24M 规模上变得可负担。

第三重:交付难。 27TB 的语料,任何"打包成一个 zip / 一个 parquet"的做法都不现实。BIOMEDICA 选择 WebDataset 分片 + 按许可分区 + streaming 读取,既是工程必需,也直接决定了使用者的工作方式(§6):你不可能"下载 BIOMEDICA",只能"流式消费 BIOMEDICA"。

这一节的实践含义:评价一个"从文献挖图文对"的数据集,不能只看它宣称多少对,还要看三个正交换算:解析保真度(图文是否真配对)、分类可用性(能否按类型取用)、交付可达性(普通团队能否用上)。BIOMEDICA 在前两项随规模增大而变难的情况下用"聚类标注 + 元数据 + 流式"给出了自己的解;open-pmc 则把重心压在解析保真(subfigure extraction)上——两条路线互补而非替代(§9.2)。

§3 数据集规格

§3.0 版本与获取渠道抉择矩阵

HF 组织 BIOMEDICA 下共 10 个数据 repo(hf-mirror API 实测),按用途分四类:

用途 repo gated 下载数 体量标签
全量主库 biomedica_webdataset_24M auto 2,885 n>1T
评测基准 Biomedica2025EvalSet false 667 100K<n<1M
检索评测 BioMedFlickr false 172 1K<n<10K
组织学子集 biomedica_histopathology_subset_webdataset auto 39 —
显微镜子集 biomedica_microscopy_subset_webdataset auto 110 —
皮肤镜子集 biomedica_dermatology_subset_webdataset auto 12 —
外科学子集 biomedica_surgery_subset_webdataset auto 5 —
皮肤镜 parquet biomedica_dermatology_subset_parquet auto 5 —
外科 parquet biomedica_surgery_subset_parquet auto 2 —
组织学 parquet biomedica_histopathology_subset_parquet auto 27 100K<n<1M

四类预滤子集(histopathology / dermatology / surgery / microscopy)各有 webdataset + parquet 两种格式;parquet 子集支持 Croissant/mlcroissant 元数据,适合不想写 WebDataset 读取器、想直接用 datasets 库的场景。

抉择建议:

  • 只要真影像做临床相关任务 → 直接取 4 类预滤子集之一,绕开 80%+ 的图表噪声;
  • 要复现 BMC-CLIP 式预训练 → 用全量主库 streaming(按许可分组 + concept 过滤);
  • 只要评测 → 用 Biomedica2025EvalSet(gated:false,即取即用);
  • 只要检索评测 → 用 BioMedFlickr(gated:false)。

§3.1 模态详情

模态 内容 备注
图像 文献图像原文(JPEG/PNG 等,来源多样) 中位 709×476 px,跨度极大
文本(图注) 每条图对应图注(caption) 单条 1~12,389 tokens,中位 64
文本(正文引用) 图与正文的行内引用(figure references) 30,711,542 条,中位 338 tokens
文本(元数据) 文章级 27 字段 PMid/publication date/citation/journal/license/title/abstract/MeSH/keywords 等
标签 global/local concept、panel-type(single/multi-panel) 由上节流水线产生

§3.2 样本与规模

指标 值 口径
唯一图像-图注对 24,076,288 v1 附录统计表(精确)
图-正文引用 30,711,542 v1 附录统计表
文章总数 6,042,494 v1 附录统计表
含图文章 5,050,473 v1 附录统计表
纯文本文章 992,021 v1 附录统计表
README 约数 “over 24M pairs and 30M image-references from 6M articles” 主库 README(约数,见坑 1)
分类法覆盖 23,271,916 图(96.7%) v1 附录

§3.3 数据格式与序列化

  • 主库:WebDataset 格式,tar 分片,每片 10,000 图像-图注对(沿用 OpenCLIP 命名约定),按 commercial/、non-commercial/、other/ 三组许可分区,编号从 000000.tar 起。
  • WebDataset 的含义:这不是"一个 tar 一个子集",而是"流式 TAR 序列"——每条记录打包为 <key>.jpg + <key>.json 等同名前缀文件集合,适合按需顺序读取、无需随机访问、天然适配多 worker 训练管线。
  • 评测集与子集:Parquet 格式,支持 datasets 库直接加载,附 Croissant/mlcroissant 元数据。
  • 为什么不给单一大文件:27TB 体量下,单文件不可行;WebDataset 分片既是工程必需,也让 streaming 成为默认访问方式。

§3.4 存储与成本

口径 值 说明
收集阶段存储 30TB NCBI FTP 下载 PMC-OA 全量(81 天)占用
HF 上数据体量 约 27TB 清洗序列化后
size_categories 标签 n>1T HF 官方分类(n>1T 指文件数>1T?实为体量标签档位)
训练方式 streaming 官方推荐:免本地下载 27TB

重要区分:30TB 与 27TB 不是同一口径——前者是原始下载占用(含中间产物),后者是最终 HF 数据体量(见坑 4)。

§3.5 元数据字段规格

  • 文章级字段:PMid、publication date、citation、journal、license、title、abstract、MeSH terms、keywords、citing-article references 等。v1 论文称 22 字段,v3 论文与 README 称 27 字段(README 原文:“over 27 unique metadata fields”,见坑 3)。
  • 图像级字段:global concept、local concept、panel-type(single-panel / multi-panel)。
  • 记录粒度:从 article 级下钻到 image-caption pair 级——每个 tar 记录是一个"图像 + 其图注 + 元数据 + 标签"的打包单元。

§3.6 标注方式与效率

环节 做法
特征 DINOv2(ViT-L-14 distilled)嵌入
降维 PCA 25 主成分
聚类 K-means,K=2000 过聚类
抽样 7 名标注者,每 cluster 抽 30 张
打标 按层级分类法打 global + local concept(可多标签)
定标签 多数投票(平票重评)
传播 按 cluster ID hash map 传播至该簇全部图像

效率宣称:24M 图像仅用 24 标注小时(7 名专家合计)。

§3.7 标注者资质

  • v3 正文口径:7 名 annotators(clinicians + scientists 混合)。
  • v1 附录口径:2 名 clinical annotators + 6 名 scientist annotators(合计 8 人)。
  • 两个口径不一致,见坑 5。作者分工(v3):AS + AL 开发主题分类法,IL/AWK/CC/JN/AS/AL/MW 执行标注。

§3.8 采集与构建周期

  • NCBI FTP 批量下载:2024-07-02 ~ 2024-09-20(81 天)。
  • 占 30TB 存储;后续解析、去重、序列化、标注、模型训练与评测另行计时。

§3.9 地域与语言覆盖

  • 源自 PubMed Central 开放获取子集,覆盖全球发表的英文生物医学文献。
  • 图注与元数据为英文;无多语言版本。
  • 源文献的地域分布未在论文中单独披露(隐含全球多国研究)。

§3.10 深度溯源链

NCBI FTP (ftp.ncbi.nlm.nih.gov/pub/pmc/oa_package)
  └─ PMC 开放获取子集(PMC-OA)
       └─ 文章 XML(图像 + 图注 + 图-正文引用 + 元数据)
            └─ 去重 + 序列化 → WebDataset tar(10,000 对/片)
                 └─ DINOv2 嵌入 → PCA → K-means → 专家抽标 → 传播
                      └─ BIOMEDICA(24M 图-注对,按许可三组分区)
                           ├─ BMC-CLIP / BMC-SmolVLM / BMC-LongCLIP(模型家族)
                           ├─ BMC-agent(RAG 助手,Index API)
                           ├─ BioMedFlickr(检索基准,7,185 行)
                           ├─ Biomedica2025EvalSet(8 套件,89,941 题)
                           └─ rex-in-the-wild(下游:采样 32,982 张)

§3.11 规模工程量化对照

把 BIOMEDICA 的规模换算成工程直觉,便于评估"值不值得用":

换算 结果 含义
每片 tar 10,000 对 全量约需 2,400+ 片 单次全量遍历要做 2,400 次 shard 读取
27TB / 单条平均图-注对 约 1.1MB/对(含图 + 文本) 图像仍是成本主体,文本占比小
6.65×10¹⁰ tokens 全文 约等于 665 亿 token 远超多数 GPU 集群单次可处理的文本量,须分块
24 标注小时 / 24M 图 约 0.0036 秒/图(人类均摊) 靠聚类传播而非逐图审阅(§8.1)
30TB 收集 / 81 天 约 370GB/天 NCBI FTP 吞吐的主要瓶颈
商业组 CC 文章约 393 万篇 / 6.04 百万篇 约 65% 但真影像仍集中在非商业组(坑 8)

结论性提醒:BIOMEDICA 的"大"是分层的——文件数多(数千 shard)、体量大(27TB)、文本 token 巨(665 亿)、人力投入却极小(24 小时)。这四者的错位正是它工程价值的来源,也是"谁适合用"的分水岭:有流式训练管线的团队能低成本用上,想"下载到本地再清理"的团队则会撞上体量墙。

§4 数据结构

§4.0 目录树与加载入口

BIOMEDICA/biomedica_webdataset_24M/   (gated:auto)
├── commercial/           # 商业可用许可组
│   ├── 000000.tar
│   ├── 000001.tar
│   └── ...
├── non-commercial/       # 非商业许可组(真影像占比最高)
│   ├── 000000.tar
│   └── ...
└── other/                # 其他许可组(逐条核查)
    ├── 000000.tar
    └── ...

单个 tar 内(WebDataset 约定):
├── 000000000.jpg         # 图像
├── 000000000.json        # 图注 + 元数据 + 标签
├── 000000001.jpg
├── 000000001.json
└── ...                   # 每 tar 10,000 对

WebDataset 读取范式(伪代码):

# pip install webdataset
import webdataset as wds

url = "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main/non-commercial/000000.tar"
ds = (
    wds.WebDataset(url)
    .decode("pil")          # 解码图像
    .to_tuple("jpg", "json")
)
for image, meta in ds:
    ...  # meta 含 caption / concepts / 元数据

§4.1 DAIMS 字段字典

下表按 DAIMS(Discoverability/Accessibility/Interoperability/Metadata/Sustainability)视角整理关键字段的来源与语义;主库 gated:auto,撰写时点无法直接抽样验证,字段名以论文方法与 README 描述为据,签署后应以实际 tar 内 JSON 为准(见坑 6)。

字段(语义) 层级 类型(推断) 取值域/说明 依据
image 图像 ImageObject 文献图像原文 README/论文方法
caption 图像 Text 英文图注,中位 64 tokens 论文方法
figure_references 图像 Text[] 图-正文行内引用 论文附录统计
global_concept 图像 Label 12 类(Clinical Imaging/Microscopy/…) §2.1 分类法
local_concept 图像 Label 170 类 §2.1 分类法
panel_type 图像 Label single-panel / multi-panel 论文方法
license_group 记录 Label commercial / non-commercial / other 分区目录
PMid 文章 String PubMed ID 论文方法
publication_date 文章 Date 发表日期 论文方法
citation 文章 Text 引文串 论文方法
journal 文章 Text 期刊名 论文方法
license 文章 Text 逐条 CC 许可 §2.5
title 文章 Text 文章标题 论文方法
abstract 文章 Text 摘要 论文方法
MeSH_terms 文章 Text[] 医学主题词 论文方法
keywords 文章 Text[] 关键词 论文方法
citing_references 文章 Text[] 引用该文的其他文章 论文方法

§4.2 评测集字段字典(Biomedica2025EvalSet,实测口径)

Biomedica2025EvalSet 为 gated:false,字段结构可实测,共 19 字段(hf-mirror API):

字段 说明
image / image_id 图像字节(parquet 内嵌原始 JPEG/PNG)+ 图像 ID
question / options / answer / answer_idx 题干、选项、答案文本、答案索引(VQA 类任务)
label 分类任务标签(image-classification 类)
suite 评测套件名(cataracts/chexpert/…)
task 任务类型(image-classification / visual-question-answering)
subset 子集名
split 划分(test)
question_type / caption_type 问型 / 图注类型
provenance_name 上游数据集名(溯源)
provenance_hub_id 上游 HF repo id
provenance_url 上游地址
provenance_license 上游许可(关键合规字段)
provenance_citation 上游引文
metadata 其他元数据(JSON 内嵌)

溯源链设计值得称道:每条样本都带 provenance_* 五件套,把"这句答案从哪个上游数据集、哪张图、什么许可来的"完整记下——这是把多个第三方评测集合并发放时的合规最佳实践。

§4.3 Biomedica2025EvalSet 套件构成(9 configs)

9 个 config = default(聚合,glob data/*/*.parquet)+ 8 个套件:

suite test 样本数
cataracts 7,000
chexpert 234
dresden 2,942
lc25000 3,750
medmnist 21,963
patchcamelyon 32,768
rsna 3,969
ubench 17,315
合计(test) 89,941
  • 总 download_size:2,054,180,939 字节(约 2.05GB)。
  • 任务类型:image-classification + visual-question-answering。
  • 许可:license:other;镜像仓 Alejandro98/Biomedica2025EvalSet。

§4.4 BioMedFlickr(检索基准,实测口径)

项 值
repo BIOMEDICA/BioMedFlickr(gated:false)
行数 7,185 行(test split)
download_size 906,819,144 字节(约 865MB)
字段 image / caption / caption_raw / title / flickr_id / url / nsid / category / tags / width / height
来源 Flickr 公开病理/显微镜相册的 7K 高质量开放许可图-注对
镜像仓 Alejandro98/BioMedFlickr
关联 CVPR 2025 poster 33761;BIOMEDICA 论文的检索评测基准

§4.5 数据层级与连接关系

文章(6,042,494)
 └─ 含图文章(5,050,473)——每篇平均 4.9 图
      └─ 图像-图注对(24,076,288)
           ├─ 图注(caption)
           ├─ 图-正文引用(30,711,542 条,每图 1.6 条)
           └─ 标签(global/local concept, panel-type)

连接键:图-注对由其所属文章串联;图-正文引用把图像重新锚回正文语境——这一层"图像↔正文"的桥是 BIOMEDICA 相对纯图-注数据集(如 ROCO 的放射子集)额外提供的能力,对检索与 RAG 场景尤其有用。

§4.6 缺失值与信息性缺失

  • 无图文章:992,021 篇纯文本文章也被收录(提供全文与元数据),但无图像-图注对——它们对纯文本任务有价值,对图文任务应过滤。
  • 无标签图像:分类法覆盖 96.7%,约 3.3% 图像未获 concept 标签(聚类未覆盖或未过阈值)。
  • 许可缺失:other 组的许可信息不完整(无机器可读 CC),属"信息性缺失"——不是数据缺失,而是"许可状态本身未知",需逐条核查。

§5 数据划分与使用建议

§5.1 官方划分

  • 主库:无官方 train/val/test 划分——它是预训练语料(大而全),不做监督式划分。使用时应自行按文章(而非按图像)切分,避免同一文章的图像跨集泄漏。
  • 评测集:Biomedica2025EvalSet 提供 test split(89,941 题),8 套件固定。
  • 检索基准:BioMedFlickr 提供 7,185 行 test。

§5.2 按文章切分的重要性

由于一篇文章平均含 4.9 张图,若按图像随机划分,同一文章的图像会同时出现在训练与验证集里,造成文章级泄漏:模型可能记住这篇文章的版面/风格而非学到通用视觉概念。强烈建议:任何在 BIOMEDICA 上做的监督任务,都以 PMid/文章 ID 为单位做 GroupSplit。

§5.3 按 concept 过滤建议

任务 建议过滤
医学影像分类/分割预训练 仅 Microscopy + Clinical Imaging(约 17%)
病理相关 Microscopy 中的病理子类,或直接用 biomedica_histopathology_subset_*
图表理解/VQA(非医学) Plots and Charts + Tables
图-文检索 全部类型,但按类型分层评测(BioMed-Flickr 即显微/病理)
化学信息学 Chemical Structures

§5.4 泄漏与合规风险清单

  1. 文章级泄漏(§5.2):按图像划分 → 必须改为按文章划分。
  2. 与下游评测集重叠:BIOMEDICA 源自 PMC-OA 全量,而许多医学 VQA/分类基准(PMC-VQA、PathVQA、SLAKE 等)也可能源自 PMC/文献——预训练语料可能与其测试集存在图像级重叠,评测前应做图像哈希去重核验。
  3. 许可越界:跨组混合使用(把非商业组数据用于商业产品)是高频违规;按目录分区取用是硬约束。
  4. 再分发:gated:auto 的接受条款要求理解数据来源与许可;再分发须遵守源文章 CC 许可,不得抹除署名。

§5.5 外部验证建议

  • 在 BioMed-Flickr 上做检索外部验证(与论文口径对齐,见 §7.2);
  • 在 Biomedica2025EvalSet 的 8 套件上做零样本分类/VQA 外部验证(注意套件间样本量悬殊,chexpert 仅 234 题);
  • 用与 BIOMEDICA 无重叠的临床数据集(如机构内私有数据)做域外泛化检验。

§6 AI 就绪指南

§6.0 云端快速启动

# Colab 示例:凭据走 Colab Secret(HF_TOKEN),不要硬编码
# pip install -U huggingface_hub webdataset pillow torch
import os
from huggingface_hub import login
login(token=os.environ["HF_TOKEN"])  # 主库 gated,须先在网页勾协议

§6.1 快速上手(WebDataset 流式)

# 1) 流式读取非商业组第一片(无需下 27TB)
import webdataset as wds

base = "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main"
url = f"{base}/non-commercial/000000.tar"

ds = wds.WebDataset(url, shardshuffle=False).decode("pil").to_tuple("jpg", "json")
for i, (img, meta) in enumerate(ds):
    if i >= 3:
        break
    print(type(img), list(meta.keys())[:10])   # 探查真实键名,与 §4.1 对表

# 2) 先探查真实键名(字段语义见 §4.1;gated 签署前预览受限,见坑 6)
#    把 meta 的真实键名与 §4.1 字段字典对表,写进你自己的加载器
# 3) 只用真影像子集(gated:false 的 4 类预滤 parquet 之一,避免图表噪声)
from datasets import load_dataset
ds = load_dataset("BIOMEDICA/biomedica_histopathology_subset_parquet", split="train")
print(ds.features)   # parquet 子集可直接查看字段

§6.2 数据获取

三层访问路径:

  1. Streaming(官方推荐):HF WebDataset 主库,免本地 27TB,边训边读;gated:auto 勾协议 + 填用途即得 token。
  2. Metadata/annotation 过滤自建子集:下载元数据与标签,按 concept / 许可 / 期刊等条件筛出你需要的 tar 分片再取。
  3. BIOMEDICA Index(检索 API):混合向量-文本检索——ChromaDB 向量库 + BM25s 稀疏索引(词频≥5 文档),支持 text/image/混合查询,平均延迟 123.89ms ± 4.07ms,查询耗时与 token 数线性相关(R=0.902)。用于 RAG 与交互式检索。

HTTP 直链下载(脚本示例):

# gated:auto 授权后,用 token 走 resolve 直链(示例:非商业组首片)
export HF_TOKEN=hf_xxx
curl -L -H "Authorization: Bearer $HF_TOKEN" \
  "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main/non-commercial/000000.tar" \
  -o nc_000000.tar

国内可替换域名为 hf-mirror.com(授权仍在 HF 侧完成)。

§6.3 预处理全流程

# 步骤 0:图像统一缩放(BMC-CLIP 沿用 OpenCLIP 固定分辨率惯例)
from PIL import Image
import torchvision.transforms as T

tf = T.Compose([T.Resize(224, interpolation=T.InterpolationMode.BICUBIC),
                T.CenterCrop(224), T.ToTensor()])

# 步骤 1:图注截断(中位 64 tokens,长尾至 12,389)
def clip_caption(text, max_chars=1000):
    return text[:max_chars]

# 步骤 2:按许可与 concept 过滤后再训练
def keep(meta, allow_groups={"commercial"}, allow_concepts={"Clinical Imaging", "Microscopy"}):
    return meta.get("license_group") in allow_groups and meta.get("global_concept") in allow_concepts

# 步骤 3:按文章 ID 做训练/验证切分,避免文章级泄漏(§5.2)

§6.4 PyTorch DataLoader 完整代码

import webdataset as wds
import torch
from torch.utils.data import DataLoader

BASE = "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main"

def build(urls, batch_size=64, num_workers=8):
    ds = (wds.WebDataset(urls, shardshuffle=True, nodesplitter=wds.split_by_node)
            .shuffle(1000)
            .decode("pil")
            .to_tuple("jpg", "json")
            .map(lambda s: (preprocess(s[0]), s[1]))   # preprocess 见 §6.3
            .batched(batch_size))
    return DataLoader(ds, batch_size=None, num_workers=num_workers)

# 流式遍历,不落地 27TB
urls = [f"{BASE}/non-commercial/{i:06d}.tar" for i in range(4)]
loader = build(urls)
for images, metas in loader:
    ...   # 训练循环

§6.5 使用陷阱提示

  • 别整库下载:27TB 不是给本地磁盘的;用 streaming 或按需取片。
  • 别忽略许可分区:commercial / non-commercial / other 是硬边界,跨用即违规。
  • 别把图表当影像:80%+ 是图表类,任务错配会得出误导结论。
  • 别按图像切分:按文章 ID 切(§5.2)。
  • 别假设字段名:gated 主库签署前无法抽样验证(坑 6),签署后先探查真实键名。

§7 评估与基准

§7.1 评测构成

  • 零样本分类:35~40 项任务(v3 基准表 35 列 + 摘要口径 40 tasks,口径不一,见坑 4)。分类域覆盖 pathology(11)、radiology(3)、ophthalmology(1)、dermatology(1)、surgery(10)、biology(9)、microscopy(4);来源包括 Micro-Bench / MedMNIST / CheXpert / Dresden。
  • 图像-文本检索:BioMed-Flickr(7,185 行)。
  • VQA 四件套:VQA-RAD / SLAKE / PathVQA / PMC-VQA。
  • 指南问答:50 道指南题(neurology / molecular pathology / pharmacogenomics,知识截至 ≤2023-01,由 double board-certified pathologist 设计)。

§7.2 BioMed-Flickr 检索结果

模型 i2t R@1 / R@10 / R@100 t2i R@1 / R@10 / R@100
BMC-CLIP 4.13 / 15.13 / 38.30 4.15 / 13.75 / 36.10
BiomedCLIP 3.70 / 12.78 / 36.27 3.94 / 13.63 / 35.63
PMC-CLIP 0.03 / 0.13 / 1.39 —
OpenCLIP 2.78 / 9.78 / 26.75 —

读法:BioMed-Flickr 是困难的检索基准——所有模型 R@1 都在个位数,BMC-CLIP 相对最好但绝对水平仍低。这说明生物医学图文检索(尤其显微镜/病理)仍是开放难题;PMC-CLIP 的近乎零分提示跨域迁移失败(它在临床影像上训练,到病理检索上几乎无效)。

§7.3 BMC-CLIP 训练与结果

  • 配方:OpenCLIP ViT-L-14 连续预训练,4×A100 × 36 epochs,6M 过滤子集,InfoNCE 损失,batch 8192,lr 1e-6,fp32,streaming。
  • 相对 PMC-CLIP:分类 +24.67%,i2t R@100 +36.91%,t2i R@100 +34.6%。
  • 相对 BiomedCLIP:8/10 子集更优,平均 +6.56%(dermatology 最高 +29.8%、ophthalmology +17.5%)。
  • 效率:整体 10× less compute。

§7.4 BMC-SmolVLM 与 BMC-agent

  • BMC-SmolVLM:SmolVLM 2.2B + LoRA,2×A100,10K 指令,LLaVA-Med 配方(<30 词 caption → 简述 prompt;>30 词 → 详述 prompt)。相对 RADFM(13B) +8.09%、相对 LMed-Flamingo(8B) +3.89%,与 LLaVA-Med(7B) 相当——用小得多的模型达到可比性能。
  • BMC-agent:RAG 助手,协议沿 clinfo.ai;50 道指南题;4 个底座模型(DeepSeek-R1 70B / Qwen2-VL 72B / GPT-4o / Llama-3.3 70B);接入 BIOMEDICA Index 后平均 +36.22%。

§7.5 模型家族(HF)

模型 说明
BMC_CLIP_CF CLIP 连续预训练模型
BMC-smolvlm1-256M / 500M / 2.2B SmolVLM 三档 + LoRA
BMC-LongCLIP 长文本 CLIP 变体(2026-03)

§7.6 评测局限与引用守则

评测体系的三处结构性局限,引用其结果时须知:

  1. 套件样本量悬殊:Biomedica2025EvalSet 的 8 套件里,patchcamelyon(32,768)与 medmnist(21,963)样本充足,而 chexpert 仅 234 题、dresden 2,942 题——小套件上的排名受抽样误差支配,不宜作为强结论。
  2. 任务数口径不一:零样本分类任务在 v3 基准表是 35 项、摘要口径是 40 项(坑 4),"BIOMEDICA 在 N 项任务上如何"这句话本身就要先声明 N 的口径。
  3. 检索基准困难度高:BioMed-Flickr 上所有模型 R@1 都在个位数(§7.2),这样的绝对水平意味着"模型间差距"容易被随机波动淹没——比较时须报告置信区间或多 seed。

四条引用守则:

  • 守则一(规模):引用 24,076,288 并注明"v1 附录统计表口径",不写 “over 24M”。
  • 守则二(配方向):引用 BMC-CLIP 相对提升时,务必同时给出对比对象(vs PMC-CLIP 还是 vs BiomedCLIP),两者数字不同(§7.3)。
  • 守则三(小套件):chexpert/dresden 等小套件的排名只作参考,不作正式模型优劣结论。
  • 守则四(时点):模型榜是发布时点快照,新模型需在 Biomedica2025EvalSet(可自测)上另测,不能拿旧榜断言当前 SOTA。

§8 方法学启示

§8.1 "嵌入聚类 + 专家抽标 + 传播"是可复制的低成本标注范式

BIOMEDICA 最有复用价值的数字不是 24M,而是 24 标注小时。其成本结构:机器负责把相似图像聚到一起(DINOv2 + PCA + K-means),人类只在每簇的 30 张样本上做高价值判断(打 concept),最后用 hash map 把标签传播回整簇。任何"语料巨大、标注预算有限、且图像有可聚类结构"的团队都能照搬。三个前置条件:① 一个足够好的领域图像嵌入器;② 一个能覆盖数据分布的层级分类法;③ 可调度、能达成多数投票一致性的领域专家。复制时的红线:传播误差——簇内异质性是标签噪声的主要来源,复现者应披露簇纯度并做抽样质检,别把"24 小时搞定 24M"当成零成本神话。这一范式在 BIOMEDICA 的语料规模上是首次公开实证,方法论价值高于数据本身。

§8.2 全量覆盖 vs 精筛:语料定位决定一切

BIOMEDICA 的"全量包含一切图类型"是特性也是陷阱。它让数据集成为文献图-文对齐与科学图表理解的理想语料,但对医学影像任务,80%+ 的图表反而是噪声。这与 ROCO 的"从 PMC-OA 里精筛放射图"路线相反:ROCO 窄而纯,BIOMEDICA 宽而杂。启示:构建语料时先问"下游是谁"——若下游是通用医学多模态,全量 + 强元数据过滤能力(BIOMEDICA 的 27 字段 + concept 标签正是为此)比精筛更灵活。

§8.3 溯源字段是合并多源评测集的合规基石

Biomedica2025EvalSet 把 8 个第三方套件合并发放,每条样本保留 provenance_name/hub_id/url/license/citation 五件套。这是把多个来源、多种许可的数据打包时保障合规的最小必要设计:使用者可逐条追溯许可,发布者不必为混许可承担不透明责任。任何做"聚合基准"的团队都应把 provenance 字段列为硬性 schema,而非可选注释。

§8.4 双论文口径治理:登记而非统一

BIOMEDICA 横跨两篇 arXiv 论文(v1 框架论文 + v3 扩展论文)与一个 CVPR 正式版,数字在多处演化:22 vs 27 元数据字段、12 vs 13 global concepts、7 vs 8 标注者、35 vs 40 评测任务。没有单一权威口径。本条目的处理:主口径定"论文附录统计表(v1)",其余口径进附录 I 登记表,条目内凡涉该数字处均注明口径。检索者面对任何跨论文数据集,都应先建立这样的口径登记表再引用。


§9 与库内条目的关系

§9.1 家族图谱与互链清单

库内条目 rid 关系 互链方向
pmc-oa(PMC-CLIP) 320 同源 PMC,不同团队/论文/规模:1,646,592 子图级对(Zhang et al. arXiv:2303.07240);BIOMEDICA 为其约 14.6 倍 双向
open-pmc(Open-PMC-18M) 45 同源 PMC-OA 的对比数据集:18M 子图-caption 对;其论文明引 BIOMEDICA 为 prior work 双向
pmc-oa-subset 360 同源 PMC OA 全文文献语料(无图文对产品形态) 双向
pmc-vqa(PMC-VQA) 270 下游任务:文献图文问答基准;BIOMEDICA 可为其预训练上游 双向
rex-in-the-wild — 直接下游:采样 32,982 张自 BIOMEDICA 的 non-commercial + Natural Images 切片 双向必链
rexgradient-160k 717 同领域影像语料(胸片),不同来源 双向
roco — 同源 PMC-OA,非同数据集:ROCO 起始 6,031,814 对筛出约 82K 放射图 双向
medicat / quilt-1m 待核 同类图-注数据集(文献/病理),共同上游叙事 双向
pathvqa / slake / vqa-rad / vqa-med / omnimedvqa 260/250/240/280/290 医学 VQA 家族,可作 BIOMEDICA 预训练模型的下游评测 单向引用
mimic-cxr / chexpert / medmnist 待核 常见下游评测/对比数据 单向引用

§9.2 分工声明:BIOMEDICA 与 pmc-oa(320)、open-pmc(45)

三者都源自 PMC,检索时最易混。分工如下:

  • pmc-oa / PMC-CLIP(rid 320):Zhang et al.(arXiv:2303.07240),子图级图文对 1,646,592(从 PMC-OA 中筛出的图文子集),HF axiong/pmc_oa,偏临床影像训练。它是"PMC 图文"这一品类中较早、规模中等的一份。
  • open-pmc / Open-PMC-18M(rid 45):Vector Institute / York University,Baghbanzadeh & Ashkezari et al.(arXiv:2506.02738,MICCAI 2026),18M 子图-caption 对,工程重点是 subfigure extraction(把多子图正确切分)以保证图文对齐保真度。其论文明确引用 BIOMEDICA 为 prior work:“bulk mining…e.g., PMC-15M and BIOMEDICA”。
  • BIOMEDICA(本条目):Stanford,24,076,288 图像-图注对(全量、不限影像类型),差异化在 27 元数据字段 + 专家层级标注 + WebDataset 流式 + Index API。

一句话分工:pmc-oa 是"PMC 图文对的较早精筛版",open-pmc 是"重子图保真的 18M 版",BIOMEDICA 是"全量 24M + 专家标注 + 流式交付版"。三者上游同源(PMC-OA)但不同团队、不同论文、不同规模、不同侧重,不构成撞库;引用时各按各的论文与仓库。

§9.3 下游关系坐实:rex-in-the-wild

库内条目 rex-in-the-wild(ReXInTheWild)的 32,982 张采样图像取自 BIOMEDICA 的 “non-commercial + Natural Images” 切片(CVPR 2025, pp.19724-19735)——BIOMEDICA 是它的直接上游图文源。rex-in-the-wild 的 FACTS 已载明"BIOMEDICA 库内此前无 status=1 条目,互链走 pmc-oa/320 上游叙述",因此本条目发布后,两者应补双向挂链:rex-in-the-wild → 上游 BIOMEDICA;BIOMEDICA → 下游 rex-in-the-wild。这是本条目对库内关系网络的一个实质补全。

§9.4 ROCO 关系厘清

ROCO 起始于 PMC-OA 的 6,031,814 图-注对(随后筛出约 82K 放射图作为 ROCO 本体);BIOMEDICA 为全量 24M 覆盖。两者同源 PMC-OA 但非同一数据集,ROCO 是库内独立既有条目,互链走"共同上游 PMC-OA"叙事,不宣示父子关系。

§9.5 检索路径建议

  • 从上游客量进:先读 pmc-oa(320) / open-pmc(45) 了解 PMC 图文家族的三种路线,再回本条目看 BIOMEDICA 的差分(全量 + 专家标注 + 流式)。
  • 从下游应用进:读 rex-in-the-wild 条目了解它如何消费 BIOMEDICA 的采样切片。
  • 从评测进:§7 结果 + Biomedica2025EvalSet / BioMedFlickr → 跨条目对比时统一"论文口径/实测口径"。
  • 从许可进:§2.5 + §6.2 → 商业可行性直接看 commercial 分区实测。

§10 避坑清单:八个已踩过的坑

坑 1:"over 24M"是约数,不是 24,076,288。主库 README 原文写 “over 24M image-caption pairs and 30M image-references from 6M unique open-source articles”——全是约数;论文 v1 附录统计表的精确值是 24,076,288 图-注对 / 30,711,542 引用 / 6,042,494 文章。两个口径都对,但写论文引用时应给精确值并注明出自附录统计表;README 约数适合口头介绍。

坑 2:HF org 名与论文脚注不一致。v1 论文脚注曾指向 BIOMEDICA-NLP/BIOMEDICA(该 id 现已无效,API 返回 Invalid username or password);实际 org 为 BIOMEDICA,主 repo 为 BIOMEDICA/biomedica_webdataset_24M。用旧 id 检索会一无所获。引用一律用现行 repo id。

坑 3:元数据字段数与 global concepts 数多口径。① 元数据字段:v1 称 22、v3/README 称 27;② global concepts:v1 正文与 v3 写 12、v1 附录统计表写 13(且正文枚举里含 PCR,附录另有 Natural Images 行);③ Plots and Charts:表值 12,389,066 而正文称 “over 13 million / 57%”。引用时要么给区间,要么注明口径来源,别把两个数当同一个。

坑 4:35 vs 40 评测任务、30TB vs 27TB 存储。① 零样本分类任务数:v3 基准表 35 列 vs 摘要口径 40 tasks;② 存储:收集阶段 30TB vs HF 体量约 27TB——是"原始下载占用(含中间产物)"与"最终数据集体量"两个不同口径,不可互换。

坑 5:标注者人数 7 vs 8。v3 正文写 7 annotators;v1 附录写 2 clinical + 6 scientist = 8 人。差异可能源于统计时点或口径(是否含分类法开发者)。引用标注人力时说明口径,别断言"恰好 7 人"。

坑 6:主库 gated:auto,字段结构无法签署前预览。biomedica_webdataset_24M 为 gated:auto(须勾选数据使用协议 + 填用途),撰写时点无法直接抽样 tar 验证字段名。本条目 §4.1 字段字典据论文与 README 转写,非实测——签署后应先用 §6.1 的探查代码确认真实键名再写硬编码加载器。对照:Biomedica2025EvalSet 与 BioMedFlickr 为 gated:false,字段可实测(§4.2/§4.4 即实测口径)。

坑 7:图像类型极度不均衡,真影像仅约 17%。Plots and Charts 一类就占 12,389,066 张(约 51.5%),Microscopy + Clinical Imaging 合计约 17%。若不做 concept 过滤直接当"医学影像数据集"用,模型学到的主要是图表而非医学图像——任务错配的典型。做影像任务请直接用 4 类预滤子集或按 global_concept 过滤。

坑 8:商用与真影像两个诉求互相拉扯。约 65% 文章是商业可用许可(CC BY/CC0/CC BY-SA/CC BY-ND),但真影像在非商业文章中占比更高(13% vs 商业 5%),导致 commercial 分区里的临床/显微影像尤其稀疏。想在商业产品里用真影像,务必先在 commercial 分区实测目标 concept 的可用样本量,别假设"商用组 = 全类型都有"。


§11 总结

§11.1 三句话总结

  1. BIOMEDICA 用"PMC-OA 全量抽取 + 专家引导聚类标注"把 6,042,494 篇开放获取文献里的图-注对攒成 24,076,288 对的超大规模生物医学图文档案,是目前公开的最大规模医学图文预训练语料之一。
  2. 它的核心方法论价值在低成本标注范式(24M 图像仅 24 标注小时)与27 元数据字段 + 层级 concept 标签带来的强过滤能力;核心工程价值在 WebDataset 流式交付(免下 27TB)。
  3. 它的主要限制是图像类型高度不均衡(真影像约 17%)与无单一统一许可(三组逐条)——它适合做视觉-语言预训练与文献图-文对齐,但用于医学影像任务前必须按 concept 过滤,商用前必须逐条核查许可。

§11.2 适合谁

  • 训练/微调生物医学视觉-语言模型的团队(CLIP 式对比预训练、VLM 指令微调);
  • 研究科学文献图-文对齐、科学图表理解、规模定律的研究者;
  • 想用 BIOMEDICA Index 构建医学 RAG 助手的产品/研究团队;
  • 需要"大规模 + 强元数据过滤"能力的语料工程研究者;
  • 做 PMC 图文家族横向对比(vs pmc-oa/open-pmc/ROCO/BiomedCLIP)的综述作者。

§11.3 不适合谁

  • 只想做医学影像分类/分割、不想做过滤的团队——应直接用 4 类预滤子集或 ROCO/PMC-15M;
  • 需要单一清晰许可、不能逐条核查的团队——BIOMEDICA 的三组异构许可会带来合规负担;
  • 需要即插即用小规模数据的入门者——27TB 与 gated 流程都有门槛;
  • 需要逐图级精确标签的任务——其标签是聚类传播所得,存在传播误差。

§11.4 30 秒决策卡

你的情况 行动
想快速跑通一个医学影像实验 取 4 类预滤 parquet 子集(gated:false 部分可即取),别碰全量主库
做生物医学 CLIP 式预训练 主库 streaming(§6.4)+ 按许可分组 + 按 concept 过滤
只要评测 Biomedica2025EvalSet(89,941 题,gated:false)+ BioMedFlickr(检索)
要商用 只用 commercial 分区,先实测目标 concept 可用量(坑 8)
想复现 BMC-CLIP 论文配方 4×A100×36ep、6M 过滤子集、batch 8192、lr 1e-6(§7.3)
引用规模数字 用 24,076,288 并注明附录统计表口径,别用 “over 24M”(坑 1)
做 RAG 医学问答 接 BIOMEDICA Index(§6.2 路径 3),协议参考 clinfo.ai

§11.5 条目内快速锚点

要找 去处
多口径数字全表 坑 3/坑 4 + 附录 I 登记表
gated 获取与 streaming 代码 §6.1 / §6.4
图像类型分布 §2.2 Table 16
评测结果 §7.2 检索 + §7.3/§7.4 模型
库内分工声明 §9.2(vs pmc-oa/open-pmc)/ §9.3(vs rex-in-the-wild)
字段字典 §4.1(主库,推断)/ §4.2(评测集,实测)

FAQ(高频问答 32 问)

A. 基础认知

Q1:BIOMEDICA 是数据集、框架还是一个模型?
三合一但数据集实体真实存在:① ETL 框架(github.com/minwoosun/biomedica-etl);② 大规模图-文数据集(HF org BIOMEDICA,主库 24,076,288 图-注对,可流式下载);③ 模型家族(BMC-CLIP / BMC-SmolVLM / BMC-LongCLIP / BMC-agent)。判定依据不是论文自称的 “scalable, open-source framework”,而是 HF 上可验证的实体数据与模型仓库——证据见 §1.0。

Q2:名字 “BIOMEDICA” 怎么来的,容易和谁混?
取自 BIOMEDical Image-CAption,全大写。最易混的是 Microsoft 的 BiomedCLIP(其数据集 PMC-15M,约 15M 对,偏临床影像)——两者命名相近但团队、数据、规模、许可都不同(§2.3)。另有 ROCO、PMC-CLIP、Open-PMC 等 PMC 系数据集也易混(§9.2)。

Q3:谁做的?
Stanford University 主导(18/19 作者),Mayo Clinic 参与 1 位作者(Chia-Chun Chiang,负责指南问答评测);通讯作者 Alejandro Lozano / Min Woo Sun / Serena Yeung-Levy。Hugging Face(Daniel van Strien / Matthew Carrigan / Omar Sanseviero)协助上传与托管。

Q4:发表在哪?
两篇 arXiv 论文:v1 arXiv:2501.07171(2025-01-13,框架论文);扩展版 arXiv:2503.22727(v1 2025-03-26,v3 2026-09-16)。正式会议版:IEEE/CVF CVPR 2025,pp.19724-19735,DOI 10.1109/CVPR52734.2025.01837(Nashville 2025-06-11~15)。引用优先级:会议版 > v3 > v1。

Q5:数据在哪发布?
Hugging Face 组织 BIOMEDICA(10 个数据 repo + 5 个模型 repo)。主库 BIOMEDICA/biomedica_webdataset_24M(gated:auto);评测集与 BioMedFlickr(gated:false);4 类预滤子集各含 webdataset + parquet 两种格式。国内可用 hf-mirror.com 镜像。

Q6:它解决什么前人没解决的问题?
三个"做不到":① 规模——此前公开医学图文语料最大也就在百万到千万级(ROCO 8 万、Quilt-1M 百万、PMC-15M 一千五百万),BIOMEDICA 做到 2,400 万并全量覆盖;② 类型——不限临床影像,覆盖显微镜/图表/化学结构等文献全类型;③ 标注与交付——专家层级分类 + 27 元数据字段 + WebDataset 流式,让"巨大但可用"成为可能。

B. 数据与获取

Q7:数据到底多大?
主库 HF 标签 size_categories n>1T;收集阶段占 30TB 存储,HF 最终体量约 27TB。两个数字口径不同(坑 4)。README 鼓励用 streaming 免本地下载。

Q8:怎么下载,要下多少?
不要整库下载。三层路径(§6.2):① streaming(推荐,边训边读);② 下载元数据/标签后按条件取特定 tar 分片;③ 用 BIOMEDICA Index 检索 API。单 tar 为 10,000 对。

Q9:gated 怎么签?
主库 gated:auto——HF 账号登录后,勾选数据使用协议(extra_gated_prompt,三组 PMC 许可声明)并填写用途即可获 token。评测集与 BioMedFlickr 是 gated:false,无需申请。gated 授权在 HF 侧完成,镜像站只是加速下载。

Q10:能商用吗?
分三组(§2.5):Commercial(CC0/CC BY/CC BY-SA/CC BY-ND,约 65% 文章)、Non-commercial(CC BY-NC 系)、Other(无机器可读 CC)。商业产品只能用 commercial 分区,且须逐条遵守源文章 CC 许可。注意商用组里真影像稀少(坑 8)。

Q11:数据格式是什么?
主库为 WebDataset(tar 分片,每片 10,000 对,按 commercial/non-commercial/other 分区);评测集与预滤子集为 Parquet(支持 datasets 库与 Croissant 元数据)。

Q12:能预览字段吗?
主库 gated:auto,撰写时点无法直接抽样(坑 6)——字段名据论文/README 转写。但 Biomedica2025EvalSet(19 字段)与 BioMedFlickr(11 字段)为 gated:false,字段可实测(§4.2/§4.4)。

C. 统计与构成

Q13:图-注对的精确数是多少?
24,076,288(v1 附录统计表)。README 写 “over 24M”(约数)。引用给精确值并注口径(坑 1)。

Q14:文章数、含图/纯文本怎么分?
文章总数 6,042,494:含图 5,050,473 + 纯文本 992,021。平均每篇 4.9 图。

Q15:图-正文引用有多少?
30,711,542 条(单条最长 699,117 tokens,中位 338)。README 约数 “30M image-references”。

Q16:图像类型是怎么分布的?
Plots and Charts 12,389,066(约 51.5%,最多);Illustrative Diagrams 2,919,995;Microscopy 2,517,332;Clinical Imaging 1,928,158;Chemical Structures 1,128,082;Immuno Assays 904,632;Tables 639,029;其余 Maps/Tools/PCR/Equations 各数十万至数万(详见 §2.2 Table 16)。

Q17:真影像占多少?
Microscopy + Clinical Imaging 合计 4,445,490,约 17%。其余八成以上是图表类(坑 7)。

Q18:分类法有多少类?
12 global concepts / 170 local concepts(正文口径;v1 附录表写 13,见坑 3)。覆盖 23,271,916 图(96.7%)。

Q19:元数据字段有多少?
v1 称 22、v3/README 称 27(坑 3)。含 PMid、publication date、citation、journal、license、title、abstract、MeSH terms、keywords、citing references 等。

Q20:文本量多大?
图注共 2.84×10⁹ tokens(单条 1~12,389,中位 64);全文共 6.65×10¹⁰ tokens。

Q21:图像尺寸范围?
中位宽 709 × 高 476 px;最大 52,490 × 65,081 px。跨度从缩略图到整页大图(§2.4)。

D. 标注与流水线

Q22:标签怎么打出来的?
专家引导流水线(§3.6):DINOv2 嵌入 → PCA 25 主成分 → K-means K=2000 过聚类 → 7 名标注者每 cluster 抽 30 张 → 打 global+local concept → 多数投票(平票重评)→ 按 cluster ID 传播至全簇。

Q23:"24 标注小时"是真的吗?
论文如此宣称(7 名专家合计 24 小时覆盖 24M 图像)。它的含义是人类总投入工时,不含机器嵌入/聚类/传播的计算时间;且标签是聚类级传播而非逐图判断,存在传播误差(§8.1)。引用时保留分寸。

Q24:谁标注的?
v3 口径 7 名 annotators(clinicians + scientists);v1 附录 2 clinical + 6 scientist = 8 人(坑 5)。

Q25:标签可靠性如何?
多数投票 + 平票重评提供了簇内一致性保障,但簇纯度有限,标签是"聚类级真相"而非"逐图真相"。对标签精度敏感的任务应自行抽样复标校准(§5.4/§8.1)。

Q26:panel-type 是什么?
图像级字段,标注 single-panel(单图)还是 multi-panel(多面板拼图)。文献图常为多面板,影响图文对齐粒度。

E. 模型与评测

Q27:由它训练了哪些模型?
BMC-CLIP(OpenCLIP ViT-L-14 连续预训练)、BMC-SmolVLM(256M/500M/2.2B + LoRA)、BMC-LongCLIP(长文本变体)、BMC-agent(RAG 助手)。对应 HF 5 个模型 repo(§7.5)。

Q28:BMC-CLIP 效果如何?
相对 PMC-CLIP 分类 +24.67%、检索 R@100 +34.6%~36.91%;相对 BiomedCLIP 8/10 子集更优、平均 +6.56%;整体 10× less compute(§7.3)。

Q29:BioMed-Flickr 检索难吗?
很难。所有模型 R@1 都是个位数——BMC-CLIP 最好(i2t 4.13 / t2i 4.15),OpenCLIP 2.78,PMC-CLIP 近乎零分(0.03,跨域失败)(§7.2)。

Q30:评测体系有多大?
零样本分类 35~40 项(口径不一,坑 4)、BioMed-Flickr 检索、VQA 四件套(VQA-RAD/SLAKE/PathVQA/PMC-VQA)、50 题指南问答。评测集 Biomedica2025EvalSet 8 套件共 89,941 题(§4.3)。

F. 库内关系与复现

Q31:和 pmc-oa(320)、open-pmc(45) 什么关系,会撞库吗?
不撞库。三者同源 PMC-OA 但不同团队/论文/规模:pmc-oa 1,646,592 子图对、open-pmc 18M 子图-caption 对(明引 BIOMEDICA 为 prior work)、BIOMEDICA 24M 全量。分工见 §9.2。

Q32:和 rex-in-the-wild 什么关系?
BIOMEDICA 是其直接上游图文源——rex-in-the-wild 的 32,982 张采样图像取自 BIOMEDICA 的 non-commercial + Natural Images 切片(§9.3)。本条目发布后应补双向挂链。

事实清单(硬事实 36 条)

  1. BIOMEDICA 全称 “BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature”(arXiv:2501.07171 标题)。
  2. 首发 arXiv:2501.07171 v1,2025-01-13(cs.CV + cs.CL,arXiv API 实测)。
  3. 扩展论文 arXiv:2503.22727 v1 2025-03-26 / v2 2025-04-01 / v3 2026-09-16(cs.CL + cs.LG,19 作者,API 实测 v3 更新日)。
  4. 正式发表于 IEEE/CVF CVPR 2025,pp.19724-19735,DOI 10.1109/CVPR52734.2025.01837,Nashville 2025-06-11~15(Crossref 实测出版日 2025-06-10)。
  5. DBLP 条目 DBLP:conf/cvpr/LozanoSB0NGLARK25;CVPR 2025 poster 编号 33761。
  6. 团队:Stanford University 主导(18/19 作者)+ Mayo Clinic(Chia-Chun Chiang);通讯 Alejandro Lozano / Min Woo Sun / Serena Yeung-Levy。
  7. 唯一图像-图注对 24,076,288(v1 附录统计表)。
  8. 图-正文行内引用 30,711,542(v1 附录统计表;v3 口径 “30 million in-line references”)。
  9. 文章总数 6,042,494 = 含图 5,050,473 + 纯文本 992,021。
  10. 平均每篇 4.9 图;每图 1.6 条 figure reference。
  11. 图注文本共 2.84×10⁹ tokens(单条 1~12,389,中位 64);全文共 6.65×10¹⁰ tokens。
  12. Figure reference 单条最长 699,117 tokens,中位 338。
  13. 图像中位 709×476 px;最大 52,490×65,081 px。
  14. 收集:NCBI FTP(ftp.ncbi.nlm.nih.gov/pub/pmc/oa_package)下载 81 天(2024-07-02 ~ 09-20),占 30TB;HF 体量约 27TB。
  15. 数据序列化为 WebDataset tar,每片 10,000 对(沿用 OpenCLIP 命名约定),按 commercial/non-commercial/other 三组许可分区。
  16. 分类法:12 global concepts / 170 local concepts(正文口径;v1 附录表写 13,坑 3),覆盖 23,271,916 图(96.7%)。
  17. 标注流水线:DINOv2(ViT-L-14 distilled)嵌入 → PCA 25 主成分 → K-means K=2000 → 7 名标注者每 cluster 抽 30 张 → 多标签 concept → 多数投票(平票重评)→ cluster 传播。
  18. 标注效率宣称:24M 图像仅用 24 标注小时(7 名专家合计)。
  19. 标注者口径:v3 写 7 人;v1 附录写 2 clinical + 6 scientist(8 人)——坑 5。
  20. global concept 图像数(Table 16):Plots and Charts 12,389,066;Illustrative Diagrams 2,919,995;Microscopy 2,517,332;Clinical Imaging 1,928,158;Chemical Structures 1,128,082;Immuno Assays 904,632;Tables 639,029;Maps 324,265;Tools and Materials 272,399;PCR 35,353;Equations 28,888。
  21. Biomedical(microscopy + clinical imaging)占比约 17%;非商业文章中占比(13%)高于商业(5%)/other(6%)。
  22. 许可分布(v1 Table 17):CC BY 3,795,419;CC BY-NC 771,755;CC BY-NC-ND 642,982;Other 414,857;CC0 132,592;CC BY-NC-SA 275,638;CC BY-ND 7,900;CC BY-SA 1,287。
  23. 许可三组(PMC 口径):Commercial allowed(CC0/CC BY/CC BY-SA/CC BY-ND)、Non-commercial only(CC BY-NC 系)、Other。
  24. 主库 HF repo BIOMEDICA/biomedica_webdataset_24M,gated:auto,2,885 downloads / 40 likes,size_categories n>1T,lastModified 2026-09-02(hf-mirror API 实测 2026-09-30)。
  25. HF 组织 BIOMEDICA 共 10 个数据 repo(主库 + 4 类预滤子集 × webdataset/parquet + 评测集 + BioMedFlickr)。
  26. 4 类预滤子集:histopathology(39 dl)、microscopy(110 dl)、dermatology(12 dl)、surgery(5 dl);对应 parquet 版 5/27/5/2 dl。
  27. Biomedica2025EvalSet:gated:false,license:other,667 dl,download_size 2,054,180,939 字节,test 89,941 题,9 configs。
  28. EvalSet 8 套件样本数:cataracts 7,000 / chexpert 234 / dresden 2,942 / lc25000 3,750 / medmnist 21,963 / patchcamelyon 32,768 / rsna 3,969 / ubench 17,315。
  29. EvalSet 19 字段含 provenance 五件套:provenance_name / provenance_hub_id / provenance_url / provenance_license / provenance_citation。
  30. BioMedFlickr:gated:false,7,185 行(test),download_size 906,819,144 字节,字段 image/caption/caption_raw/title/flickr_id/url/nsid/category/tags/width/height;镜像 Alejandro98/BioMedFlickr。
  31. BioMed-Flickr 检索:BMC-CLIP i2t 4.13/15.13/38.30、t2i 4.15/13.75/36.10;BiomedCLIP 3.70/12.78/36.27 与 3.94/13.63/35.63;PMC-CLIP 0.03/0.13/1.39;OpenCLIP 2.78/9.78/26.75。
  32. BMC-CLIP 配方:OpenCLIP ViT-L-14 连续预训练,4×A100×36 epochs,6M 过滤子集,InfoNCE,batch 8192,lr 1e-6,fp32,streaming;vs PMC-CLIP 分类 +24.67%、i2t R@100 +36.91%、t2i R@100 +34.6%;vs BiomedCLIP 8/10 子集更优、平均 +6.56%;10× less compute。
  33. BMC-SmolVLM:SmolVLM 2.2B + LoRA,2×A100,10K 指令,LLaVA-Med 配方;vs RADFM(13B) +8.09%、vs LMed-Flamingo(8B) +3.89%。
  34. BMC-agent:RAG 协议沿 clinfo.ai,50 道指南题(neurology/molecular pathology/pharmacogenomics,≤2023-01 知识,double board-certified pathologist 设计),4 底座(DeepSeek-R1 70B / Qwen2-VL 72B / GPT-4o / Llama-3.3 70B),接入 Index 后平均 +36.22%。
  35. 模型 repo:BMC_CLIP_CF、BMC-smolvlm1-256M/500M/2.2B、BMC-LongCLIP(2026-03)。
  36. ETL 代码 github.com/minwoosun/biomedica-etl;CLIP 训练 github.com/Ale9806/open_clip_with_biomedica;官网 https://minwoosun.github.io/biomedica-website(HF README 给出,GitHub Pages,沙箱不可达)。

术语表(30 条)

# 术语 释义
1 BIOMEDICA 本条目数据集;BIOMEDical Image-Caption 全大写缩写
2 PMC-OA PubMed Central Open Access Subset,美国国立医学图书馆的开放获取文献子集
3 image-caption pair 图像-图注对;本数据集的记录粒度
4 figure reference 图-正文行内引用;正文中指向某图的文字引用
5 WebDataset 基于 tar 分片的流式数据格式,把同 key 文件打包成一条记录
6 shard 分片;本数据集每片含 10,000 图像-图注对
7 streaming 流式加载;边读边训,免本地下载全量
8 global concept 分类法第一层,12 类图像大类(如 Plots and Charts)
9 local concept 分类法第二层,170 类细粒度标签
10 panel-type 图像级字段:single-panel / multi-panel
11 DINOv2 Meta 自监督视觉基础模型,用作本数据集图像嵌入器(ViT-L-14 distilled)
12 过聚类(over-clustering) K-means K=2000,聚出远多于真实类别的簇以提升纯度
13 PCA 主成分分析;把 DINOv2 嵌入降到 25 维
14 多数投票 簇内 30 张样本的标签投票定簇标签(平票重评)
15 标签传播 用 hash map 按 cluster ID 把簇标签分派给全簇图像
16 BMC-CLIP 由 BIOMEDICA 训练的 CLIP 式模型(OpenCLIP ViT-L-14 连续预训练)
17 BMC-SmolVLM 由 BIOMEDICA 微调的 SmolVLM(256M/500M/2.2B + LoRA)
18 BMC-LongCLIP 长文本变体 CLIP 模型(2026-03)
19 BMC-agent 基于 BIOMEDICA Index 的检索增强生成(RAG)医学助手
20 BIOMEDICA Index 混合向量-文本检索 API(ChromaDB + BM25s)
21 RAG Retrieval-Augmented Generation,检索增强生成
22 InfoNCE 对比学习损失函数;CLIP 式训练常用
23 连续预训练(continual pretraining) 在已有预训练权重上继续用领域数据训练
24 LoRA 低秩适配微调方法,用小参数量适配大模型
25 zero-shot classification 零样本分类;不微调直接用模型分类
26 R@K Recall@K 检索指标;前 K 个结果是否命中
27 i2t / t2i image-to-text / text-to-image 检索方向
28 Croissant / mlcroissant 数据集元数据标准(MLCommons),本数据集 parquet 子集支持
29 gated dataset 需登录并勾选协议方可下载的 HF 发布形式;主库为 gated:auto
30 DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维数据集评估框架

附录

附录 A:条目信息速查卡

项 值
条目名 BIOMEDICA
url_name biomedica
类型 大规模图文档案 + ETL 框架 + 模型家族(三件套)
论文 CVPR 2025(DOI 10.1109/CVPR52734.2025.01837);arXiv:2501.07171 与 arXiv:2503.22727
团队 Stanford University(主导)× Mayo Clinic;HF 托管
规模 24,076,288 图-注对 × 6,042,494 文章(口径见坑 1)
许可 无统一许可;逐条沿承 PMC-OA CC,分 commercial/non-commercial/other 三组
抓取时点 2026-09-30
URL 占位 https://www.qianfanghub.com/ai-ready-dataset/biomedica/734
库内互链 rex-in-the-wild(下游)·pmc-oa(320)·open-pmc(45)·pmc-oa-subset(360)·pmc-vqa(270)·rexgradient-160k(717)·roco·medicat

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 8 双 arXiv + CVPR DOI + HF org 明确;但论文脚注旧 org id 失效(坑 2)轻微干扰检索
A 可获取性 6 主库 gated:auto + 27TB 体量;但评测集/子集/BioMedFlickr gated:false 与 streaming 是强补偿
I 可互操作 7 WebDataset 通用格式 + Parquet 子集含 Croissant;27 字段强过滤;扣分于主库字段签署前不可预览(坑 6)
M 元数据质量 8 27 元数据字段 + 专家层级分类 + panel-type;但元数据字段数 22/27、global 12/13 等多口径(坑 3)扣分
S 可持续性 7 HF 长期托管 + ETL 开源 + 增量管线;扣分于无统一许可带来的长期合规维护负担
综合评级 7.2/10(良) 规模、元数据、方法论均优;获取门槛与许可异构是主要摩擦,适合研究团队而非即插即用

附录 C:逐项证据链自证

关键数字 来源 位置/方式
CVPR 2025 pp.19724-19735 / DOI IEEE/CVF CVPR 2025 论文集 Crossref API 实测(2026-09-30)
arXiv:2501.07171(2025-01-13)标题 arXiv API 实测标题与 published 字段
arXiv:2503.22727(2025-03-26,v3 2026-09-16) arXiv API 实测 published/updated
24,076,288 图-注对 / 6,042,494 文章 论文 v1 附录统计表 论文正文转写
主库 2,885 dl / 40 likes / gated:auto / n>1T HF API hf-mirror api/datasets/BIOMEDICA/biomedica_webdataset_24M
EvalSet 89,941 / 2,054,180,939 B / 9 configs HF API + cardData hf-mirror 实测
BioMedFlickr 7,185 / 906,819,144 B / gated:false HF API hf-mirror 实测
HF org 10 数据 repo 清单与下载数 HF API hf-mirror 全量盘点
Table 16 各 concept 图像数 论文 v1 Table 16 论文正文转写
BioMed-Flickr 检索分数 论文 v3 结果表 论文正文转写
README “over 24M…” 原文 主库数据集卡 description hf-mirror API description 字段实抓

附录 D:数据获取决策树

需求是什么?
├── 只想"看看长什么样"
│   └── BioMedFlickr / EvalSet(gated:false)直接 load_dataset;主库字段签署后探查(坑 6)
├── 做生物医学 CLIP 式预训练
│   ├── 1) HF 勾选主库 gated 协议 → 取 token
│   ├── 2) 按 commercial/non-commercial/other 选分区
│   ├── 3) 按 global concept 过滤(去图表)→ streaming 读取
│   └── 4) 按文章 ID 切分,防泄漏(§5.2)
├── 做医学影像任务(分类/分割)
│   └── 直接用 4 类预滤子集(histopathology/dermatology/surgery/microscopy)
├── 商业用途
│   └── 仅 commercial 分区;先实测目标 concept 可用量(坑 8),逐条核查 CC
├── 要评测
│   └── Biomedica2025EvalSet(8 套件 89,941 题)+ BioMedFlickr(检索)
└── 做 RAG 医学问答
    └── 接 BIOMEDICA Index(§6.2 路径 3),协议参考 clinfo.ai

附录 E:图像类型与任务匹配表

global concept 图像数 适配任务 备注
Plots and Charts 12,389,066 图表理解、数据提取 占比最大(约 51.5%),非医学影像
Illustrative Diagrams 2,919,995 示意图理解、图文对齐 非医学影像
Microscopy 2,517,332 病理/显微图像分类、检索 真影像,医学相关
Clinical Imaging 1,928,158 临床影像分类 真影像,医学相关
Chemical Structures 1,128,082 化学信息学、分子识别 非医学影像
Immuno Assays 904,632 免疫检测图像理解 真影像,实验类
Tables 639,029 表格理解、信息抽取 非影像
Maps 324,265 空间信息 非医学
Tools and Materials 272,399 器材识别 非医学
PCR 35,353 分子生物学 真影像/凝胶图
Equations 28,888 公式识别 非影像

附录 F:低成本标注流水线复现骨架(SOP 模板)

阶段 0 前置(周级)
  - 领域图像嵌入器(如 DINOv2 微调版)
  - 层级分类法草案(global + local,含定义与示例)
  - 专家资源排期(目标:达成多数投票一致性)

阶段 1 机器侧(计算主导)
  - 全量图像过嵌入器 → 得到向量
  - PCA 降维(本数据集用 25 维)
  - K-means 过聚类(K 取真实类别数的数倍,本数据集 2000)

阶段 2 人工侧(人力主导)
  - 每 cluster 随机抽 30 张
  - 专家打 global + local 多标签
  - 多数投票定簇标签;平票样本重评

阶段 3 传播与质检
  - 按 cluster ID hash map 传播标签到全簇
  - 抽样复标测簇纯度;披露传播误差(本数据集未充分披露——补上这一课)
  - 计算覆盖率(本数据集 96.7%)

阶段 4 交付治理
  - 元数据字段冻结为 schema(本数据集 27 字段)
  - 按许可分组分区(commercial/non-commercial/other)
  - WebDataset 分片(每片 10,000 对)
  - 建立检索 API(向量 + 稀疏混合)

附录 G:BMC 模型家族对照表

模型 底座 训练配置 关键相对结果
BMC-CLIP OpenCLIP ViT-L-14(连续预训练) 4×A100×36ep,6M 过滤子集,InfoNCE,batch 8192,lr 1e-6 vs PMC-CLIP 分类 +24.67%;vs BiomedCLIP 平均 +6.56%
BMC-SmolVLM-256M/500M/2.2B SmolVLM + LoRA 2×A100,10K 指令,LLaVA-Med 配方 vs RADFM(13B) +8.09%;vs LMed-Flamingo(8B) +3.89%
BMC-LongCLIP 长文本 CLIP 变体 2026-03 发布 长图注场景
BMC-agent RAG 助手(4 底座) 协议沿 clinfo.ai;接入 Index 指南问答平均 +36.22%

附录 H:许可与合规速查

许可组 含 CC 类型 可用场景 官方目录
Commercial allowed CC0 / CC BY / CC BY-SA / CC BY-ND 商业与研究(须署名,ND 禁改) commercial/
Non-commercial only CC BY-NC / CC BY-NC-SA / CC BY-NC-ND 仅非商业 non-commercial/
Other 无机器可读 CC / 自定义 逐条核查 other/

红线:① 跨组混合后商用 = 违规;② 抹除署名 = 违规;③ 假设"商用组 = 全类型齐备" = 高风险(真影像在商用组稀少,坑 8);④ 使用前逐条核对源文章 license 字段。

附录 I:多口径登记表

# 项 口径 A(主) 口径 B 口径 C 处理
1 图文对规模 24,076,288(v1 附录统计表) “over 24M”(README 约数) — 引用用 A,口头介绍可用 B
2 元数据字段数 22(v1) 27(v3 + README) — 注明所得来源版本
3 global concepts 数 12(正文/v3) 13(v1 附录表) — 用 A,B 存照
4 标注者人数 7(v3 正文) 8 = 2+6(v1 附录) — 注明口径
5 Plots and Charts 12,389,066(表值) “over 13 million / 57%”(正文) — 用表值 A,正文存照
6 存储 30TB(收集阶段) 27TB(HF 体量) — 不同口径,不可互换
7 评测任务数 35(v3 基准表) 40(摘要) — 注明口径
8 官网 minwoosun.github.io/biomedica-website(README) biomedica-ai.github.io(首轮误记) — 用 A
9 旧 org id BIOMEDICA-NLP/BIOMEDICA(v1 脚注,已失效) BIOMEDICA(现行) — 用 B

附录 J:维护计划与触发点

触发点 条件 动作 优先级
新版本发布 arXiv 出 v4 / HF 主库大改 §1.4 时间轴与 §4 数据规模复核 1
许可变更 PMC-OA 许可体系或 HF gated 条款更新 §2.5/附录 H 重写 2
rex-in-the-wild 落库 其条目 status=1 补双向挂链(§9.3) 3
字段实测 签署后抽样主库 tar §4.1 升级为实测口径 4
新评测套件 EvalSet 增 config §4.3 表更新 5
模型家族扩张 新 BMC-* repo 上线 附录 G 更新 6

附录 K:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ 双 arXiv + CVPR DOI + HF repo
F2 富元数据 ✅ 27 字段 + 层级分类 + panel-type
A1 可访问协议 ⚠️ 主库 gated:auto;评测集/子集/BioMedFlickr 开放
A2 元数据可访问 ✅ 论文/数据卡/README 公开可读
I1 互操作格式 ✅ WebDataset(通用)+ Parquet(含 Croissant)
I2 词汇表引用 ✅ 自建 concept 分级分类法
R1 来源溯源 ✅ PMC-OA 谱系明确;EvalSet 带 provenance 五件套
R3 可复现流程 ⚠️ ETL 开源,但标注传播误差未充分披露
AI-Ready 综合 良 规模与元数据优、流式交付强;gated 与许可异构是中摩擦

附录 L:缩写速查

缩写 全称
PMC / PMC-OA PubMed Central / PMC Open Access Subset
CLIP Contrastive Language-Image Pretraining
VLM Vision-Language Model
VQA Visual Question Answering
RAG Retrieval-Augmented Generation
BM25 Best Matching 25(稀疏检索算法)
PCA Principal Component Analysis
LoRA Low-Rank Adaptation
InfoNCE Information Noise-Contrastive Estimation
CVPR IEEE/CVF Conference on Computer Vision and Pattern Recognition
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
DUO Data Use Ontology

附录 M:基于本数据集的研究检查清单(12 项)

  1. 许可核对:用途是否落在所取目录分区的 CC 范围内?跨组混用即止。
  2. concept 过滤:医学影像任务是否已过滤掉图表类?(真影像仅约 17%)
  3. 文章级切分:训练/验证是否按 PMid 切分,而非按图像?(§5.2)
  4. 去重核验:与下游评测集是否有图像级重叠?(§5.4)
  5. 字段实证:主库字段名以签署后抽样为准(坑 6),不用论文描述硬编码。
  6. 规模口径:引用 24,076,288 而非 “over 24M”(坑 1)。
  7. 商用量实测:commercial 分区内目标 concept 样本量是否足用?(坑 8)
  8. 标注兜底:对标签精度敏感的任务,自行抽样复标(§8.1)。
  9. 流式训练:用 streaming 而非整库下载(27TB)。
  10. 模型复现:BMC-CLIP 配方(§7.3)须逐项对齐(batch 8192 / lr 1e-6 / 36ep)。
  11. 检索评测:BioMed-Flickr 的 R@K 绝对值低,跨模型对比须控制变量。
  12. 时点存照:HF 下载数等为抓取快照,引用注明日期(本条目基准时点 2026-09-30)。

附录 N:主库字段字典(论文口径,签署前推断版)

字段(语义) 类型(推断) 取值域 依据
image ImageObject 图像原文 README/论文
caption Text 英文图注 论文方法
figure_references Text[] 图-正文引用 论文附录
global_concept Label 12 类 §2.1
local_concept Label 170 类 §2.1
panel_type Label single/multi 论文方法
license_group Label commercial/non-commercial/other 分区目录
文章级 27 字段 mixed PMid/date/citation/journal/license/title/abstract/MeSH/keywords/… 论文方法

升级路径:本表为签署前推断版(坑 6);签署后实测字段名/类型/嵌套结构后按附录 J 触发点 4 升级。自检建议:抽样应能复现 Table 16 的 concept 分布形状与 96.7% 覆盖率。

附录 O:引文规范

@inproceedings{lozano2025biomedica,
  title     = {BIOMEDICA: An Open Biomedical Image-Caption Archive,
               Dataset, and Vision-Language Models Derived from Scientific
               Literature},
  author    = {Lozano, Alejandro and Sun, Min Woo and Burgess, James and
               others},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision
               and Pattern Recognition (CVPR)},
  pages     = {19724--19735},
  year      = {2025},
  doi       = {10.1109/CVPR52734.2025.01837}
}

@article{lozano2025biomedicaarxiv,
  title   = {BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset,
             and Vision-Language Models Derived from Scientific Literature},
  author  = {Lozano, Alejandro and Sun, Min Woo and Burgess, James and
             others},
  journal = {arXiv preprint arXiv:2501.07171},
  year    = {2025}
}

@article{lozano2025large,
  title   = {A Large-Scale Vision-Language Dataset Derived from Open
             Scientific Literature to Advance Biomedical Generalist AI},
  author  = {Lozano, Alejandro and Sun, Min Woo and Burgess, James and
             others},
  journal = {arXiv preprint arXiv:2503.22727},
  year    = {2025}
}

附录 P:检索路径示范(关键词组合与查询式)

目标 推荐查询式 预期命中
本体论文 “BIOMEDICA” OR arXiv:2501.07171 OR doi:10.1109/CVPR52734.2025.01837 arXiv/CVPR 页
数据仓库 HF API datasets?author=BIOMEDICA HF org 10 个数据 repo
主库 huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M 主库页面
模型家族 HF models?author=BIOMEDICA BMC-* 模型
ETL 代码 github minwoosun biomedica-etl ETL 仓库
下游关系 “rex-in-the-wild” BIOMEDICA rex-in-the-wild 论文
PMC 家族对比 PMC-OA image-caption dataset PMC-CLIP open-pmc 同源文献
反例(勿用) 旧 org “BIOMEDICA-NLP/BIOMEDICA” 直搜 会命中的是失效 id(坑 2)

检索卫生两条:一、认准 repo id BIOMEDICA/biomedica_webdataset_24M(旧 id 已失效);二、别把 “over 24M” 当精确值引用(坑 1)。


尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 arXiv:2501.07171、arXiv:2503.22727、IEEE/CVF CVPR 2025 正式版(DOI 10.1109/CVPR52734.2025.01837)与 HuggingFace 组织 BIOMEDICA 的仓库 API 实测(hf-mirror,2026-09-30)为源;元数据字段数 22/27、global concepts 12/13、标注者 7/8、Plots and Charts 表值 vs 正文、30TB vs 27TB、35 vs 40 任务等原始文档口径差异已在坑点与附录 I 存照。主库 gated:auto 导致字段结构无法签署前实测(坑 6),字段字典(§4.1/附录 N)为论文与 README 口径的推断版。条目与库内 rex-in-the-wild(直接下游)、pmc-oa(320)、open-pmc(45)、pmc-oa-subset(360)、pmc-vqa(270)、rexgradient-160k(717)、ROCO 等条目互链,构成 PMC 图文语料家族与生物医学多模态预训练生态的完整检索面。后续维护触发点见附录 J。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • quilt-1m — 共享标签:医学影像 / 多模态 / 影像-文本对齐
  • medicat — 共享标签:多模态 / 影像-文本对齐 / 生物医学文献
  • pmc-oa — 共享标签:多模态 / 影像-文本对齐 / 生物医学文献
  • openi — 共享标签:医学影像 / 影像-文本对齐 / 评测基准
  • roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐
  • skincap — 共享标签:多模态 / 影像-文本对齐 / 图像分类
  • derm1m — 共享标签:多模态 / 影像-文本对齐 / 评测基准
  • ms-cxr-t — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
  • vlm3d — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
  • padchest — 共享标签:医学影像 / 多模态 / 图像分类

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集