信息速览
BIOMEDICA — 生物医学图文档案 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | BIOMEDICA |
| 英文全称 | BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature |
| 别名/简称 | BIOMEDICA(HF org 同名);主库 BIOMEDICA/biomedica_webdataset_24M;勿与 Microsoft 的 BiomedCLIP/PMC-15M、ROCO 混淆(见 §2.3、§9.2) |
| 疾病分类 | 全医学与生命科学谱系(源自 PMC 开放获取文献,无统一 ICD 归类;图像级按 12 global / 170 local concept 分类,见 §2.1) |
| SNOMED CT | 不适用(语料级数据集,非单一疾病;按 concept taxonomy 组织) |
| 数据模态 | 生物医学图像(显微镜、临床影像、图表、示意图、化学结构等)+ 英文图注文本 + 图-正文行内引用 + 文章级元数据 |
| AI 任务类型 | 视觉-语言对比预训练(CLIP 式)、图像-文本检索、图像分类、VQA、检索增强生成(RAG)、科学文献图-文对齐研究 |
| 样本总数 | 24,076,288 个唯一图像-图注对;30,711,542 条图-正文行内引用;6,042,494 篇文章(5,050,473 含图 + 992,021 纯文本) |
| 数据大小 | HF 标签 size_categories n>1T;收集阶段占存储 30TB,HF 体量约 27TB;训练靠 streaming 免下载 |
| 数据格式 | WebDataset(tar 分片,每片 10,000 对);评测集与 BioMedFlickr 为 Parquet |
| 许可证 | 无单一统一许可:逐条沿承 PMC-OA 源文章 CC 许可,分三组(Commercial allowed / Non-commercial only / Other);主库 gated:auto |
| 访问级别 | 申请(HuggingFace gated:auto:勾选数据使用协议 + 填写用途;评测集与子集 gated:false) |
| DUO 标签 | 按许可分组承载(商业可用组近似 DUO 开放;非商业组近似 NPUNCU 非商业非营利;other 组需逐条核查) |
| 语言 | 图注与元数据为英文(源自英文开放获取文献) |
| 首发日期 | 2025-01-13(arXiv:2501.07171 v1);扩展版 2025-03-26(arXiv:2503.22727) |
| 最后更新 | arXiv:2503.22727 v3 更新 2026-09-16;HF 主库 lastModified 2026-09-02 |
| 发布机构 | Stanford University(主导,18/19 作者)× Mayo Clinic(Chia-Chun Chiang);Hugging Face 托管 |
| 官方主页 | https://minwoosun.github.io/biomedica-website(HF README 给出的官网;GitHub Pages,沙箱不可达) |
| 下载地址 | https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M(gated:auto);国内可走 hf-mirror.com 镜像(授权仍在 HF 侧完成) |
| DOI | 10.1109/CVPR52734.2025.01837(CVPR 2025 正式版);预印本 10.48550/arXiv.2501.07171 / 10.48550/arXiv.2503.22727 |
| 引用次数 | 精确计数以 Google Scholar 页面为准(截至 2026-09 查询时点未采信具体数字;CVPR 2025 正式发表后引用仍在增长) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 27 元数据字段 + 专家层级标注 + WebDataset 流式 + 双论文文档完备;扣分项:gated 申请、无单一统一许可(三组逐条)、图像类型高度不均衡(真影像仅约 17%)、标注为聚类传播而非逐图人工 |
| 页面状态 | published |
导语读法三则:
- 只想下数据:直奔 §6.2 获取流程——注意这里是 streaming 优先的 27TB 库(
gated:auto勾协议即得),不要试图整库下载;先按许可分组(commercial / non-commercial / other)决定取哪一片,再按 global concept 过滤掉图表类。 - 关心规模与口径:直奔坑 1("over 24M"约数 vs 24,076,288 精确值)与附录 I 多口径登记表——论文附录、README、v1/v3 之间存在多处数字分叉,引用前先看口径。
- 做测评/选上游:先读 §7.2 与 §9——BIOMEDICA 是 rex-in-the-wild 的直接上游图文源(32,982 张采样自其 non-commercial + Natural Images 切片),也是 open-pmc 论文明引的 prior work;与库内 pmc-oa(320)/pmc-oa-subset(360) 同源 PMC-OA 但不同数据集。
§0 E-E-A-T 信任声明与免责声明
审核声明:本条目由千方病案医数集编辑部于 2026-09-30 基于一手来源撰写与审核。核心事实经三源互证:① arXiv 论文全文(2501.07171、2503.22727,API 实测标题与版本日期 2026-09-30);② IEEE/CVF CVPR 2025 会议出版记录(Crossref API 实测 DOI 10.1109/CVPR52734.2025.01837、页码 19724-19735);③ HuggingFace 组织 BIOMEDICA 数据与模型仓库元数据(经 hf-mirror.com 镜像 API 实测:主库下载数、gated 状态、size_categories、评测集与 BioMedFlickr 的样本数与字节数)。所有关键数字在正文标注出处;文档之间的数字冲突不在正文中强行统一,而是在坑点与附录 I 逐条存照。
医学免责声明:本条目为数据集技术文档,不构成临床建议。BIOMEDICA 是从已发表开放获取文献中抽取的图像-图注档案,其图像与文本反映原文献的研究语境,标签体系(global/local concept)描述的是图像类型而非诊断结论。任何基于本数据集训练或评测的模型输出均不得直接用于临床诊断决策。使用时须逐条遵守源文章的 CC 许可要求。
数据免责声明:本条目所述数据以发布时点的官方仓库状态为准(抓取时点 2026-09-30)。HuggingFace 数据卡与两版论文之间存在多处数字口径差异(元数据字段数、global concepts 数、标注者数、Plots and Charts 计数、任务数),本条目以"论文附录统计表口径"为主口径、"README/v1/v3 口径"并列存照,检索者引用任何数字前应先核对附录 I 的口径登记表。主库为 gated:auto,撰写时点无法直接抽样原文验证字段结构,字段字典据论文与 README 转写。
AI 参与声明:本条目由 AI 辅助起草并经人工校验(详见 §10 AI 使用声明卡)。
§1 数据集概览
§1.0 30 秒速览
BIOMEDICA 把 PubMed Central 开放获取(PMC-OA)文献里"每一张图 + 它下面那段图注"成对抽出、清洗、打标,攒成一个 2,400 万对的超大规模生物医学图-文档案。它的目标不是采集新数据,而是把已经公开发表、已经有图注写的科学图像变成可直接喂给 CLIP 式视觉-语言模型训练的高质量语料——用论文自己的话说,是让生物医学多模态模型拥有属于本领域的"图文预训练底座"。
三句话抓住它:
- 规模:24,076,288 图-注对、30,711,542 条图-正文引用、6,042,494 篇文章、27 个元数据字段——比库内同源的 pmc-oa(320)(约 164 万对)大约 14.6 倍,是目前公开的最大规模生物医学图文配对档案之一。
- 方法:专家引导的标注流水线(DINOv2 嵌入 + PCA + K-means 过聚类 + 7 名专家每簇抽 30 张 + 多数投票 + 簇传播),宣称用 24 标注小时给 2,400 万张图打上 12 global / 170 local concept 标签。
- 衍生:由它训练出 BMC-CLIP、BMC-SmolVLM(256M/500M/2.2B)、BMC-LongCLIP 模型家族与 BMC-agent 检索增强助手;并在 35-40 项零样本分类、BioMed-Flickr 检索、VQA 与指南问答上评测。
一句话定性:BIOMEDICA 是一个"科学文献 ETL 框架 + 超大规模图文语料 + 自研模型家族"三件套,数据集本体真实存在且可流式获取,判定为可立项的 AI-Ready 数据集(非纯框架)。
档位判定的关键证据:HF 组织 BIOMEDICA 下实存 10 个数据 repo(主库 + 4 类预滤子集 × webdataset/parquet + 评测集 + BioMedFlickr),主库 biomedica_webdataset_24M 有 2,885 次下载、40 likes、size n>1T,且支持 WebDataset 流式加载——数据实体可验证,不受"论文自称 framework"措辞影响。
§1.1 技术摘要
| 维度 | 内容 |
|---|---|
| 全称 | BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature |
| 团队 | Stanford University(主导,18/19 作者)+ Mayo Clinic(Chia-Chun Chiang);通讯 Alejandro Lozano / Min Woo Sun / Serena Yeung-Levy |
| 首发 | arXiv:2501.07171(2025-01-13,cs.CV + cs.CL) |
| 扩展版 | arXiv:2503.22727(v1 2025-03-26 / v2 2025-04-01 / v3 2026-09-16,cs.CL + cs.LG,19 作者) |
| 正式发表 | IEEE/CVF CVPR 2025,pp.19724-19735,Nashville 2025-06-11~15,DOI 10.1109/CVPR52734.2025.01837 |
| 核心规模 | 24,076,288 图-注对;6,042,494 文章;30,711,542 图引用;27 元数据字段;12 global / 170 local concepts |
| 数据格式 | WebDataset tar(10,000 对/片),按 commercial / non-commercial / other 三组许可分区 |
| 模型家族 | BMC-CLIP、BMC-SmolVLM(256M/500M/2.2B)、BMC-LongCLIP、BMC-agent |
| 获取 | HF org BIOMEDICA;主库 gated:auto;评测集/子集 gated:false |
| 许可 | 无单一统一许可,逐条沿承 PMC-OA 源文章 CC 许可,分三组 |
| 代码 | github.com/minwoosun/biomedica-etl(ETL);github.com/Ale9806/open_clip_with_biomedica(CLIP 训练) |
§1.2 战略价值
- 对生物医学多模态:在 BIOMEDICA 之前,公开的医学图文配对语料要么规模偏小(ROCO 约 8 万放射图、Quilt-1M 约百万级),要么局限于特定模态(PMC-15M 偏临床影像)。BIOMEDICA 以"PMC-OA 全量 + 不限影像类型 + 专家层级标注"补齐了"领域级图文预训练底座"这一格。
- 对科学文献挖掘:它把"文献图-文抽取"从一次性研究变成一个可复用的 ETL 框架(biomedica-etl)与可增量更新的数据管线,为后续任何"文献→多模态语料"的工程提供模板。
- 对评测生态:配套的 BioMed-Flickr 检索基准与 Biomedica2025EvalSet(8 大评测套件,89,941 题)让"用文献语料训练的模型该在哪评"有了统一出口;BMC-agent 的 RAG 协议(沿 clinfo.ai)又把语料接入了临床问答场景。
- 对数据工程方法论:24M 图像仅用 24 标注小时,是"嵌入聚类 + 专家抽标 + 传播"这一范式在超大规模下的公开实证,对任何"标注预算有限但语料巨大"的团队都有直接参考价值。
§1.3 同类数据集横向对比
| 数据集 | 图像-图注对规模 | 图像范围 | 来源 | 标注 | 许可 |
|---|---|---|---|---|---|
| BIOMEDICA(本条目) | 24,076,288 | 全类型(图表为主,真影像约 17%) | PMC-OA | 专家层级分类(12/170 concepts) | 逐条 CC,三组 |
| BiomedCLIP / PMC-15M | 约 15,000,000 | 临床影像为主 | PMC | 无专家分类 | 学术 |
| open-pmc(Open-PMC-18M) | 约 18,000,000 | 子图-caption,重子图抽取保真 | PMC-OA | 无专家分类 | 学术 |
| pmc-oa / PMC-CLIP | 1,646,592 | 子图级 | PMC | 无专家分类 | CC 混合 |
| ROCO | 约 82,000(放射图) | 放射影像(自 6,031,814 对筛出) | PMC-OA | 人工筛放射 | 公开 |
| Quilt-1M | 约 1,000,000 | 病理 | 多源(YouTube 等) | 无 | 多样 |
读表要点:BIOMEDICA 的差异化不在"影像质量更高"(恰恰相反,它 51% 以上是图表),而在全量覆盖 + 元数据字段 + 专家分类 + 流式交付。做医学影像任务要先按 concept 过滤;做文献图-文对齐/规模定律才是它的主场。
§1.4 版本时间轴
| 时间 | 事件 |
|---|---|
| 2024-07-02 ~ 09-20 | NCBI FTP 批量下载 PMC-OA 子集,历时 81 天,占 30TB 存储 |
| 2025-01-13 | arXiv:2501.07171 v1 发布(“scalable, open-source framework” 口径,附录统计表基准) |
| 2025-03-26 | 扩展论文 arXiv:2503.22727 v1 发布(“A Large-Scale Vision-Language Dataset…”) |
| 2025-04-01 | 两篇论文同日更新:2501.07171 v3、2503.22727 v2 |
| 2025-06-11~15 | CVPR 2025(Nashville)展示,poster 编号 33761 |
| 2025-06-10 | CVPR 2025 论文集出版(DOI 10.1109/CVPR52734.2025.01837) |
| 2026-08-20 | Biomedica2025EvalSet 更新(lastModified,gated:false) |
| 2026-09-02 | HF 主库与 BioMedFlickr lastModified |
| 2026-09-16 | arXiv:2503.22727 v3 更新(扩展版最新) |
§1.5 典型应用场景
- CLIP 式对比预训练:用 24M 图-注对对 OpenCLIP ViT-L-14 等底座做领域连续预训练(BMC-CLIP 即此路线,10× less compute 于同类)。
- 医学图-文检索:构建文献图检索、以文搜图、以图搜文系统;BioMed-Flickr 可作为检索评测。
- VLM 指令微调语料:BMC-SmolVLM 用小规模指令(10K)即达可比性能,适合资源受限团队。
- 检索增强生成(RAG)医学问答:BIOMEDICA Index(向量 + BM25 混合索引)支撑 BMC-agent 类临床助手。
- 科学文献图-文对齐研究:研究图表在文献中的分布、图文语义对齐、规模定律。
- 零样本分类评测:Biomedica2025EvalSet 的 8 大套件提供跨模态、跨器官的评测出口。
§2 医学背景与数据构成
§2.1 分类法:12 global / 170 local concepts
BIOMEDICA 的组织轴不是器官或疾病,而是图像类型(concept)。团队用一套自底向上归纳的层级分类法给图像打标:
- Global concepts(第一层):12 类(正文口径)——Clinical Imaging、Microscopy、Plots and Charts、Immuno Assays、Illustrative Diagrams、Scientific Formulae and Equations、Tables、Hand Drawn and Screen Based Visuals、Graph and Network、Chemical Structures、Maps、Tools and Materials、PCR(注:正文枚举见 §3.5,附录另有 Natural Images 行,附录统计表写 13,见坑 3)。
- Local concepts(第二层):170 类,颗粒度更细。其中 Plots and Charts 的子类最粗(96 个 local concept),Clinical Imaging 有 34 个 local(MRI/CT/ultrasound 等)。
标签如何产生(专家引导流水线):DINOv2(ViT-L-14 distilled)图像嵌入 → PCA 降到 25 主成分 → K-means 过聚类 K=2000 → 7 名标注者(clinicians + scientists)每 cluster 抽 30 张 → 按层级分类法打 global + local concept(可多标签)→ 多数投票定标签(平票重评)→ 按 cluster ID 用 hash map 传播到该簇全部图像。
这决定了你的用法:标签是"聚类级"而非"逐图级"。同一 cluster 内所有图像共享由 30 张样本投票得出的标签——高效但存在传播误差。若你的任务对单图标签精度敏感,务必在自己的子集上复标校准。
标签覆盖率:分类法覆盖 23,271,916 张图,占 24M 的 96.7%。
§2.2 图像类型分布(Table 16 口径)
按 global concept 统计图像数(Commercial / Non-commercial / Other / 合计):
| global concept | Commercial | Non-commercial | Other | 合计 |
|---|---|---|---|---|
| Plots and Charts | 542,718 | 9,426,147 | 2,394,358 | 12,389,066 |
| Illustrative Diagrams | 140,925 | 2,227,690 | 551,380 | 2,919,995 |
| Microscopy | 101,617 | 1,818,302 | 597,413 | 2,517,332 |
| Clinical Imaging | 82,349 | 1,078,901 | 766,908 | 1,928,158 |
| Chemical Structures | 92,881 | 839,082 | 196,119 | 1,128,082 |
| Immuno Assays | 38,055 | 651,339 | 215,238 | 904,632 |
| Tables | 26,190 | 269,384 | 343,455 | 639,029 |
| Maps | 18,700 | 264,092 | 41,473 | 324,265 |
| Tools and Materials | 10,320 | 210,740 | 51,339 | 272,399 |
| PCR | 2,307 | 25,353 | 7,693 | 35,353 |
| Equations | 2,322 | 20,384 | 6,182 | 28,888 |
关键观察:
- 真影像只占少数:Microscopy(2,517,332)+ Clinical Imaging(1,928,158)合计 4,445,490,占 24M 的约 17%(论文口径 “Biomedical(microscopy + clinical imaging)仅占 17%”)。其余八成以上是图表、示意图、结构式、表格等。
- 商业可用子集极稀:Commercial 列各项合计远小于非商业,且真影像在非商业类文章中占比更高(13% vs 商业 5% / other 6%)——意味着"想商用"与"想要真影像"两个诉求在 BIOMEDICA 里互相拉扯,商业可用切片里临床影像尤其稀缺。
- Plots and Charts 是绝对多数:12,389,066 张,约 51.5%(论文正文另有 “over 13 million / 57%” 的表述,表文不一,见坑 3)。
§2.3 与易混淆数据集的关系
| 名称 | 关系 | 关键区分点 |
|---|---|---|
| BIOMEDICA(本条目) | 本体 | 24M 全量、全类型、专家分类、27 字段、WebDataset 流式、Stanford |
| BiomedCLIP(Microsoft) | 无直接血缘,常被检索混淆 | 微软出品;PMC-15M,约 15M 对,偏临床影像;命名与 BIOMEDICA 不同但均含 “BioMed” |
| ROCO(Pelka 2018) | 同源 PMC-OA,非同数据集 | ROCO 起始于 PMC-OA 的 6,031,814 图-注对,筛出约 82K 放射图;BIOMEDICA 是全量 24M;库内 ROCO 为独立条目 |
| pmc-oa / PMC-CLIP(320) | 同源 PMC,不同团队/论文/规模 | 1,646,592 子图级对(Zhang et al. arXiv:2303.07240);BIOMEDICA 为其约 14.6 倍;见 §9.2 |
| open-pmc(45) / Open-PMC-18M | 同源 PMC-OA,对比关系 | 18M 子图-caption 对(Vector Institute/York U,MICCAI 2026);其论文明引 BIOMEDICA 为 prior work;重 subfigure extraction 保真对齐 |
| rex-in-the-wild | BIOMEDICA 的下游 | 其 32,982 张采样图像取自 BIOMEDICA 的 “non-commercial + Natural Images” 切片;BIOMEDICA 是其直接上游图文源;见 §9.3 |
§2.4 文本与图像规格
| 维度 | 数据 |
|---|---|
| 图注 tokens 总量 | 2.84 × 10⁹ tokens(单条 1 ~ 12,389 tokens,中位 64) |
| 全文 tokens 总量 | 6.65 × 10¹⁰ tokens |
| 图-正文行内引用 | 30,711,542 条(单条最长 699,117 tokens,中位 338) |
| 每篇文章平均 | 4.9 张图;每图 1.6 条图-正文引用 |
| 图像尺寸 | 中位宽 709 × 高 476 px;最大宽 52,490 × 高 65,081 px(跨缩略图至整页大图) |
| 图像总类数 | 24,076,288 对 / 6,042,494 文章 |
规格隐含的工程载荷:图注 token 分布极长尾(中位 64 但最长逾 1.2 万),全文 token 达 6.65×10¹⁰,直接全量文本训练需要分块与截断策略;图像尺寸跨度从缩略图到 5 万像素级整页大图,预处理须统一缩放管线(BMC-CLIP 沿用 OpenCLIP 惯例的固定分辨率)。
§2.5 文章与许可构成
- 文章总数:6,042,494(含图文章 5,050,473 + 纯文本文章 992,021)。
- 许可分布(v1 Table 17):
| 许可 | 文章数 | 分组(PMC 口径) |
|---|---|---|
| CC BY | 3,795,419 | Commercial allowed |
| CC BY-NC | 771,755 | Non-commercial only |
| CC BY-NC-ND | 642,982 | Non-commercial only |
| Other | 414,857 | Other |
| CC0 | 132,592 | Commercial allowed |
| CC BY-NC-SA | 275,638 | Non-commercial only |
| CC BY-ND | 7,900 | Commercial allowed |
| CC BY-SA | 1,287 | Commercial allowed |
商用可行性的真相:粗略看,商业可用(CC0 + CC BY + CC BY-SA + CC BY-ND)合计约 3,937,198 篇,占约 65%;但真影像在非商业文章中占比更高,所以"商用 + 真影像 + 足量"这个交集远小于表面数字。做商业产品前请务必在 commercial 分区内实测你的目标 concept 的可用样本量。
§2.6 文献图文抽取的工程背景
要理解 BIOMEDICA 为什么值得做、难在哪,得先看"把科学文献变成图文语料"这件事的三重工程难度:
第一重:解析难。 PMC 文章以 JATS XML 形式提供,图像与其图注通过 <fig> 元素关联,但真实文献里这张关联并不规整——有的图注只有一句话,有的长达一万多 token(BIOMEDICA 实测图注最长 12,389 tokens);有的一篇文章几十张图,图与正文的引用关系散落在 Methods、Results、Discussion 各处。BIOMEDICA 抽取出的 30,711,542 条 figure reference(每图平均 1.6 条)正是这一层"图—正文"桥的量化产物,也是它相较只抽"图 + 图注"的数据集(如早期 ROCO)多出来的语境信息。
第二重:分类难。 一旦语料是全量的,图像类型就会极其杂:研究论文里既有显微镜照片、临床影像,也有折线图、示意图、化学结构式、表格、地图、器材照片。不做分类,语料就无法按下游任务取用。但给 2,400 万张图人工分类不现实——这正是 BIOMEDICA 引入专家引导聚类标注(§3.6)的动因:先用 DINOv2 把"看起来像"的图聚到一起,再让专家只判断每簇的 30 张代表。这套方法论的代价与价值:代价是标签是聚类级的、有传播误差;价值是让"全量分类"第一次在 24M 规模上变得可负担。
第三重:交付难。 27TB 的语料,任何"打包成一个 zip / 一个 parquet"的做法都不现实。BIOMEDICA 选择 WebDataset 分片 + 按许可分区 + streaming 读取,既是工程必需,也直接决定了使用者的工作方式(§6):你不可能"下载 BIOMEDICA",只能"流式消费 BIOMEDICA"。
这一节的实践含义:评价一个"从文献挖图文对"的数据集,不能只看它宣称多少对,还要看三个正交换算:解析保真度(图文是否真配对)、分类可用性(能否按类型取用)、交付可达性(普通团队能否用上)。BIOMEDICA 在前两项随规模增大而变难的情况下用"聚类标注 + 元数据 + 流式"给出了自己的解;open-pmc 则把重心压在解析保真(subfigure extraction)上——两条路线互补而非替代(§9.2)。
§3 数据集规格
§3.0 版本与获取渠道抉择矩阵
HF 组织 BIOMEDICA 下共 10 个数据 repo(hf-mirror API 实测),按用途分四类:
| 用途 | repo | gated | 下载数 | 体量标签 |
|---|---|---|---|---|
| 全量主库 | biomedica_webdataset_24M |
auto | 2,885 | n>1T |
| 评测基准 | Biomedica2025EvalSet |
false | 667 | 100K<n<1M |
| 检索评测 | BioMedFlickr |
false | 172 | 1K<n<10K |
| 组织学子集 | biomedica_histopathology_subset_webdataset |
auto | 39 | — |
| 显微镜子集 | biomedica_microscopy_subset_webdataset |
auto | 110 | — |
| 皮肤镜子集 | biomedica_dermatology_subset_webdataset |
auto | 12 | — |
| 外科学子集 | biomedica_surgery_subset_webdataset |
auto | 5 | — |
| 皮肤镜 parquet | biomedica_dermatology_subset_parquet |
auto | 5 | — |
| 外科 parquet | biomedica_surgery_subset_parquet |
auto | 2 | — |
| 组织学 parquet | biomedica_histopathology_subset_parquet |
auto | 27 | 100K<n<1M |
四类预滤子集(histopathology / dermatology / surgery / microscopy)各有 webdataset + parquet 两种格式;parquet 子集支持 Croissant/mlcroissant 元数据,适合不想写 WebDataset 读取器、想直接用 datasets 库的场景。
抉择建议:
- 只要真影像做临床相关任务 → 直接取 4 类预滤子集之一,绕开 80%+ 的图表噪声;
- 要复现 BMC-CLIP 式预训练 → 用全量主库 streaming(按许可分组 + concept 过滤);
- 只要评测 → 用 Biomedica2025EvalSet(gated:false,即取即用);
- 只要检索评测 → 用 BioMedFlickr(gated:false)。
§3.1 模态详情
| 模态 | 内容 | 备注 |
|---|---|---|
| 图像 | 文献图像原文(JPEG/PNG 等,来源多样) | 中位 709×476 px,跨度极大 |
| 文本(图注) | 每条图对应图注(caption) | 单条 1~12,389 tokens,中位 64 |
| 文本(正文引用) | 图与正文的行内引用(figure references) | 30,711,542 条,中位 338 tokens |
| 文本(元数据) | 文章级 27 字段 | PMid/publication date/citation/journal/license/title/abstract/MeSH/keywords 等 |
| 标签 | global/local concept、panel-type(single/multi-panel) | 由上节流水线产生 |
§3.2 样本与规模
| 指标 | 值 | 口径 |
|---|---|---|
| 唯一图像-图注对 | 24,076,288 | v1 附录统计表(精确) |
| 图-正文引用 | 30,711,542 | v1 附录统计表 |
| 文章总数 | 6,042,494 | v1 附录统计表 |
| 含图文章 | 5,050,473 | v1 附录统计表 |
| 纯文本文章 | 992,021 | v1 附录统计表 |
| README 约数 | “over 24M pairs and 30M image-references from 6M articles” | 主库 README(约数,见坑 1) |
| 分类法覆盖 | 23,271,916 图(96.7%) | v1 附录 |
§3.3 数据格式与序列化
- 主库:WebDataset 格式,tar 分片,每片 10,000 图像-图注对(沿用 OpenCLIP 命名约定),按
commercial/、non-commercial/、other/三组许可分区,编号从000000.tar起。 - WebDataset 的含义:这不是"一个 tar 一个子集",而是"流式 TAR 序列"——每条记录打包为
<key>.jpg+<key>.json等同名前缀文件集合,适合按需顺序读取、无需随机访问、天然适配多 worker 训练管线。 - 评测集与子集:Parquet 格式,支持
datasets库直接加载,附 Croissant/mlcroissant 元数据。 - 为什么不给单一大文件:27TB 体量下,单文件不可行;WebDataset 分片既是工程必需,也让 streaming 成为默认访问方式。
§3.4 存储与成本
| 口径 | 值 | 说明 |
|---|---|---|
| 收集阶段存储 | 30TB | NCBI FTP 下载 PMC-OA 全量(81 天)占用 |
| HF 上数据体量 | 约 27TB | 清洗序列化后 |
| size_categories 标签 | n>1T |
HF 官方分类(n>1T 指文件数>1T?实为体量标签档位) |
| 训练方式 | streaming | 官方推荐:免本地下载 27TB |
重要区分:30TB 与 27TB 不是同一口径——前者是原始下载占用(含中间产物),后者是最终 HF 数据体量(见坑 4)。
§3.5 元数据字段规格
- 文章级字段:PMid、publication date、citation、journal、license、title、abstract、MeSH terms、keywords、citing-article references 等。v1 论文称 22 字段,v3 论文与 README 称 27 字段(README 原文:“over 27 unique metadata fields”,见坑 3)。
- 图像级字段:global concept、local concept、panel-type(single-panel / multi-panel)。
- 记录粒度:从 article 级下钻到 image-caption pair 级——每个 tar 记录是一个"图像 + 其图注 + 元数据 + 标签"的打包单元。
§3.6 标注方式与效率
| 环节 | 做法 |
|---|---|
| 特征 | DINOv2(ViT-L-14 distilled)嵌入 |
| 降维 | PCA 25 主成分 |
| 聚类 | K-means,K=2000 过聚类 |
| 抽样 | 7 名标注者,每 cluster 抽 30 张 |
| 打标 | 按层级分类法打 global + local concept(可多标签) |
| 定标签 | 多数投票(平票重评) |
| 传播 | 按 cluster ID hash map 传播至该簇全部图像 |
效率宣称:24M 图像仅用 24 标注小时(7 名专家合计)。
§3.7 标注者资质
- v3 正文口径:7 名 annotators(clinicians + scientists 混合)。
- v1 附录口径:2 名 clinical annotators + 6 名 scientist annotators(合计 8 人)。
- 两个口径不一致,见坑 5。作者分工(v3):AS + AL 开发主题分类法,IL/AWK/CC/JN/AS/AL/MW 执行标注。
§3.8 采集与构建周期
- NCBI FTP 批量下载:2024-07-02 ~ 2024-09-20(81 天)。
- 占 30TB 存储;后续解析、去重、序列化、标注、模型训练与评测另行计时。
§3.9 地域与语言覆盖
- 源自 PubMed Central 开放获取子集,覆盖全球发表的英文生物医学文献。
- 图注与元数据为英文;无多语言版本。
- 源文献的地域分布未在论文中单独披露(隐含全球多国研究)。
§3.10 深度溯源链
NCBI FTP (ftp.ncbi.nlm.nih.gov/pub/pmc/oa_package)
└─ PMC 开放获取子集(PMC-OA)
└─ 文章 XML(图像 + 图注 + 图-正文引用 + 元数据)
└─ 去重 + 序列化 → WebDataset tar(10,000 对/片)
└─ DINOv2 嵌入 → PCA → K-means → 专家抽标 → 传播
└─ BIOMEDICA(24M 图-注对,按许可三组分区)
├─ BMC-CLIP / BMC-SmolVLM / BMC-LongCLIP(模型家族)
├─ BMC-agent(RAG 助手,Index API)
├─ BioMedFlickr(检索基准,7,185 行)
├─ Biomedica2025EvalSet(8 套件,89,941 题)
└─ rex-in-the-wild(下游:采样 32,982 张)
§3.11 规模工程量化对照
把 BIOMEDICA 的规模换算成工程直觉,便于评估"值不值得用":
| 换算 | 结果 | 含义 |
|---|---|---|
| 每片 tar 10,000 对 | 全量约需 2,400+ 片 | 单次全量遍历要做 2,400 次 shard 读取 |
| 27TB / 单条平均图-注对 | 约 1.1MB/对(含图 + 文本) | 图像仍是成本主体,文本占比小 |
| 6.65×10¹⁰ tokens 全文 | 约等于 665 亿 token | 远超多数 GPU 集群单次可处理的文本量,须分块 |
| 24 标注小时 / 24M 图 | 约 0.0036 秒/图(人类均摊) | 靠聚类传播而非逐图审阅(§8.1) |
| 30TB 收集 / 81 天 | 约 370GB/天 | NCBI FTP 吞吐的主要瓶颈 |
| 商业组 CC 文章约 393 万篇 / 6.04 百万篇 | 约 65% | 但真影像仍集中在非商业组(坑 8) |
结论性提醒:BIOMEDICA 的"大"是分层的——文件数多(数千 shard)、体量大(27TB)、文本 token 巨(665 亿)、人力投入却极小(24 小时)。这四者的错位正是它工程价值的来源,也是"谁适合用"的分水岭:有流式训练管线的团队能低成本用上,想"下载到本地再清理"的团队则会撞上体量墙。
§4 数据结构
§4.0 目录树与加载入口
BIOMEDICA/biomedica_webdataset_24M/ (gated:auto)
├── commercial/ # 商业可用许可组
│ ├── 000000.tar
│ ├── 000001.tar
│ └── ...
├── non-commercial/ # 非商业许可组(真影像占比最高)
│ ├── 000000.tar
│ └── ...
└── other/ # 其他许可组(逐条核查)
├── 000000.tar
└── ...
单个 tar 内(WebDataset 约定):
├── 000000000.jpg # 图像
├── 000000000.json # 图注 + 元数据 + 标签
├── 000000001.jpg
├── 000000001.json
└── ... # 每 tar 10,000 对
WebDataset 读取范式(伪代码):
# pip install webdataset
import webdataset as wds
url = "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main/non-commercial/000000.tar"
ds = (
wds.WebDataset(url)
.decode("pil") # 解码图像
.to_tuple("jpg", "json")
)
for image, meta in ds:
... # meta 含 caption / concepts / 元数据
§4.1 DAIMS 字段字典
下表按 DAIMS(Discoverability/Accessibility/Interoperability/Metadata/Sustainability)视角整理关键字段的来源与语义;主库 gated:auto,撰写时点无法直接抽样验证,字段名以论文方法与 README 描述为据,签署后应以实际 tar 内 JSON 为准(见坑 6)。
| 字段(语义) | 层级 | 类型(推断) | 取值域/说明 | 依据 |
|---|---|---|---|---|
| image | 图像 | ImageObject | 文献图像原文 | README/论文方法 |
| caption | 图像 | Text | 英文图注,中位 64 tokens | 论文方法 |
| figure_references | 图像 | Text[] | 图-正文行内引用 | 论文附录统计 |
| global_concept | 图像 | Label | 12 类(Clinical Imaging/Microscopy/…) | §2.1 分类法 |
| local_concept | 图像 | Label | 170 类 | §2.1 分类法 |
| panel_type | 图像 | Label | single-panel / multi-panel | 论文方法 |
| license_group | 记录 | Label | commercial / non-commercial / other | 分区目录 |
| PMid | 文章 | String | PubMed ID | 论文方法 |
| publication_date | 文章 | Date | 发表日期 | 论文方法 |
| citation | 文章 | Text | 引文串 | 论文方法 |
| journal | 文章 | Text | 期刊名 | 论文方法 |
| license | 文章 | Text | 逐条 CC 许可 | §2.5 |
| title | 文章 | Text | 文章标题 | 论文方法 |
| abstract | 文章 | Text | 摘要 | 论文方法 |
| MeSH_terms | 文章 | Text[] | 医学主题词 | 论文方法 |
| keywords | 文章 | Text[] | 关键词 | 论文方法 |
| citing_references | 文章 | Text[] | 引用该文的其他文章 | 论文方法 |
§4.2 评测集字段字典(Biomedica2025EvalSet,实测口径)
Biomedica2025EvalSet 为 gated:false,字段结构可实测,共 19 字段(hf-mirror API):
| 字段 | 说明 |
|---|---|
| image / image_id | 图像字节(parquet 内嵌原始 JPEG/PNG)+ 图像 ID |
| question / options / answer / answer_idx | 题干、选项、答案文本、答案索引(VQA 类任务) |
| label | 分类任务标签(image-classification 类) |
| suite | 评测套件名(cataracts/chexpert/…) |
| task | 任务类型(image-classification / visual-question-answering) |
| subset | 子集名 |
| split | 划分(test) |
| question_type / caption_type | 问型 / 图注类型 |
| provenance_name | 上游数据集名(溯源) |
| provenance_hub_id | 上游 HF repo id |
| provenance_url | 上游地址 |
| provenance_license | 上游许可(关键合规字段) |
| provenance_citation | 上游引文 |
| metadata | 其他元数据(JSON 内嵌) |
溯源链设计值得称道:每条样本都带 provenance_* 五件套,把"这句答案从哪个上游数据集、哪张图、什么许可来的"完整记下——这是把多个第三方评测集合并发放时的合规最佳实践。
§4.3 Biomedica2025EvalSet 套件构成(9 configs)
9 个 config = default(聚合,glob data/*/*.parquet)+ 8 个套件:
| suite | test 样本数 |
|---|---|
| cataracts | 7,000 |
| chexpert | 234 |
| dresden | 2,942 |
| lc25000 | 3,750 |
| medmnist | 21,963 |
| patchcamelyon | 32,768 |
| rsna | 3,969 |
| ubench | 17,315 |
| 合计(test) | 89,941 |
- 总 download_size:2,054,180,939 字节(约 2.05GB)。
- 任务类型:image-classification + visual-question-answering。
- 许可:
license:other;镜像仓Alejandro98/Biomedica2025EvalSet。
§4.4 BioMedFlickr(检索基准,实测口径)
| 项 | 值 |
|---|---|
| repo | BIOMEDICA/BioMedFlickr(gated:false) |
| 行数 | 7,185 行(test split) |
| download_size | 906,819,144 字节(约 865MB) |
| 字段 | image / caption / caption_raw / title / flickr_id / url / nsid / category / tags / width / height |
| 来源 | Flickr 公开病理/显微镜相册的 7K 高质量开放许可图-注对 |
| 镜像仓 | Alejandro98/BioMedFlickr |
| 关联 | CVPR 2025 poster 33761;BIOMEDICA 论文的检索评测基准 |
§4.5 数据层级与连接关系
文章(6,042,494)
└─ 含图文章(5,050,473)——每篇平均 4.9 图
└─ 图像-图注对(24,076,288)
├─ 图注(caption)
├─ 图-正文引用(30,711,542 条,每图 1.6 条)
└─ 标签(global/local concept, panel-type)
连接键:图-注对由其所属文章串联;图-正文引用把图像重新锚回正文语境——这一层"图像↔正文"的桥是 BIOMEDICA 相对纯图-注数据集(如 ROCO 的放射子集)额外提供的能力,对检索与 RAG 场景尤其有用。
§4.6 缺失值与信息性缺失
- 无图文章:992,021 篇纯文本文章也被收录(提供全文与元数据),但无图像-图注对——它们对纯文本任务有价值,对图文任务应过滤。
- 无标签图像:分类法覆盖 96.7%,约 3.3% 图像未获 concept 标签(聚类未覆盖或未过阈值)。
- 许可缺失:other 组的许可信息不完整(无机器可读 CC),属"信息性缺失"——不是数据缺失,而是"许可状态本身未知",需逐条核查。
§5 数据划分与使用建议
§5.1 官方划分
- 主库:无官方 train/val/test 划分——它是预训练语料(大而全),不做监督式划分。使用时应自行按文章(而非按图像)切分,避免同一文章的图像跨集泄漏。
- 评测集:Biomedica2025EvalSet 提供 test split(89,941 题),8 套件固定。
- 检索基准:BioMedFlickr 提供 7,185 行 test。
§5.2 按文章切分的重要性
由于一篇文章平均含 4.9 张图,若按图像随机划分,同一文章的图像会同时出现在训练与验证集里,造成文章级泄漏:模型可能记住这篇文章的版面/风格而非学到通用视觉概念。强烈建议:任何在 BIOMEDICA 上做的监督任务,都以 PMid/文章 ID 为单位做 GroupSplit。
§5.3 按 concept 过滤建议
| 任务 | 建议过滤 |
|---|---|
| 医学影像分类/分割预训练 | 仅 Microscopy + Clinical Imaging(约 17%) |
| 病理相关 | Microscopy 中的病理子类,或直接用 biomedica_histopathology_subset_* |
| 图表理解/VQA(非医学) | Plots and Charts + Tables |
| 图-文检索 | 全部类型,但按类型分层评测(BioMed-Flickr 即显微/病理) |
| 化学信息学 | Chemical Structures |
§5.4 泄漏与合规风险清单
- 文章级泄漏(§5.2):按图像划分 → 必须改为按文章划分。
- 与下游评测集重叠:BIOMEDICA 源自 PMC-OA 全量,而许多医学 VQA/分类基准(PMC-VQA、PathVQA、SLAKE 等)也可能源自 PMC/文献——预训练语料可能与其测试集存在图像级重叠,评测前应做图像哈希去重核验。
- 许可越界:跨组混合使用(把非商业组数据用于商业产品)是高频违规;按目录分区取用是硬约束。
- 再分发:gated:auto 的接受条款要求理解数据来源与许可;再分发须遵守源文章 CC 许可,不得抹除署名。
§5.5 外部验证建议
- 在 BioMed-Flickr 上做检索外部验证(与论文口径对齐,见 §7.2);
- 在 Biomedica2025EvalSet 的 8 套件上做零样本分类/VQA 外部验证(注意套件间样本量悬殊,chexpert 仅 234 题);
- 用与 BIOMEDICA 无重叠的临床数据集(如机构内私有数据)做域外泛化检验。
§6 AI 就绪指南
§6.0 云端快速启动
# Colab 示例:凭据走 Colab Secret(HF_TOKEN),不要硬编码
# pip install -U huggingface_hub webdataset pillow torch
import os
from huggingface_hub import login
login(token=os.environ["HF_TOKEN"]) # 主库 gated,须先在网页勾协议
§6.1 快速上手(WebDataset 流式)
# 1) 流式读取非商业组第一片(无需下 27TB)
import webdataset as wds
base = "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main"
url = f"{base}/non-commercial/000000.tar"
ds = wds.WebDataset(url, shardshuffle=False).decode("pil").to_tuple("jpg", "json")
for i, (img, meta) in enumerate(ds):
if i >= 3:
break
print(type(img), list(meta.keys())[:10]) # 探查真实键名,与 §4.1 对表
# 2) 先探查真实键名(字段语义见 §4.1;gated 签署前预览受限,见坑 6)
# 把 meta 的真实键名与 §4.1 字段字典对表,写进你自己的加载器
# 3) 只用真影像子集(gated:false 的 4 类预滤 parquet 之一,避免图表噪声)
from datasets import load_dataset
ds = load_dataset("BIOMEDICA/biomedica_histopathology_subset_parquet", split="train")
print(ds.features) # parquet 子集可直接查看字段
§6.2 数据获取
三层访问路径:
- Streaming(官方推荐):HF WebDataset 主库,免本地 27TB,边训边读;gated:auto 勾协议 + 填用途即得 token。
- Metadata/annotation 过滤自建子集:下载元数据与标签,按 concept / 许可 / 期刊等条件筛出你需要的 tar 分片再取。
- BIOMEDICA Index(检索 API):混合向量-文本检索——ChromaDB 向量库 + BM25s 稀疏索引(词频≥5 文档),支持 text/image/混合查询,平均延迟 123.89ms ± 4.07ms,查询耗时与 token 数线性相关(R=0.902)。用于 RAG 与交互式检索。
HTTP 直链下载(脚本示例):
# gated:auto 授权后,用 token 走 resolve 直链(示例:非商业组首片)
export HF_TOKEN=hf_xxx
curl -L -H "Authorization: Bearer $HF_TOKEN" \
"https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main/non-commercial/000000.tar" \
-o nc_000000.tar
国内可替换域名为 hf-mirror.com(授权仍在 HF 侧完成)。
§6.3 预处理全流程
# 步骤 0:图像统一缩放(BMC-CLIP 沿用 OpenCLIP 固定分辨率惯例)
from PIL import Image
import torchvision.transforms as T
tf = T.Compose([T.Resize(224, interpolation=T.InterpolationMode.BICUBIC),
T.CenterCrop(224), T.ToTensor()])
# 步骤 1:图注截断(中位 64 tokens,长尾至 12,389)
def clip_caption(text, max_chars=1000):
return text[:max_chars]
# 步骤 2:按许可与 concept 过滤后再训练
def keep(meta, allow_groups={"commercial"}, allow_concepts={"Clinical Imaging", "Microscopy"}):
return meta.get("license_group") in allow_groups and meta.get("global_concept") in allow_concepts
# 步骤 3:按文章 ID 做训练/验证切分,避免文章级泄漏(§5.2)
§6.4 PyTorch DataLoader 完整代码
import webdataset as wds
import torch
from torch.utils.data import DataLoader
BASE = "https://huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M/resolve/main"
def build(urls, batch_size=64, num_workers=8):
ds = (wds.WebDataset(urls, shardshuffle=True, nodesplitter=wds.split_by_node)
.shuffle(1000)
.decode("pil")
.to_tuple("jpg", "json")
.map(lambda s: (preprocess(s[0]), s[1])) # preprocess 见 §6.3
.batched(batch_size))
return DataLoader(ds, batch_size=None, num_workers=num_workers)
# 流式遍历,不落地 27TB
urls = [f"{BASE}/non-commercial/{i:06d}.tar" for i in range(4)]
loader = build(urls)
for images, metas in loader:
... # 训练循环
§6.5 使用陷阱提示
- 别整库下载:27TB 不是给本地磁盘的;用 streaming 或按需取片。
- 别忽略许可分区:
commercial/non-commercial/other是硬边界,跨用即违规。 - 别把图表当影像:80%+ 是图表类,任务错配会得出误导结论。
- 别按图像切分:按文章 ID 切(§5.2)。
- 别假设字段名:gated 主库签署前无法抽样验证(坑 6),签署后先探查真实键名。
§7 评估与基准
§7.1 评测构成
- 零样本分类:35~40 项任务(v3 基准表 35 列 + 摘要口径 40 tasks,口径不一,见坑 4)。分类域覆盖 pathology(11)、radiology(3)、ophthalmology(1)、dermatology(1)、surgery(10)、biology(9)、microscopy(4);来源包括 Micro-Bench / MedMNIST / CheXpert / Dresden。
- 图像-文本检索:BioMed-Flickr(7,185 行)。
- VQA 四件套:VQA-RAD / SLAKE / PathVQA / PMC-VQA。
- 指南问答:50 道指南题(neurology / molecular pathology / pharmacogenomics,知识截至 ≤2023-01,由 double board-certified pathologist 设计)。
§7.2 BioMed-Flickr 检索结果
| 模型 | i2t R@1 / R@10 / R@100 | t2i R@1 / R@10 / R@100 |
|---|---|---|
| BMC-CLIP | 4.13 / 15.13 / 38.30 | 4.15 / 13.75 / 36.10 |
| BiomedCLIP | 3.70 / 12.78 / 36.27 | 3.94 / 13.63 / 35.63 |
| PMC-CLIP | 0.03 / 0.13 / 1.39 | — |
| OpenCLIP | 2.78 / 9.78 / 26.75 | — |
读法:BioMed-Flickr 是困难的检索基准——所有模型 R@1 都在个位数,BMC-CLIP 相对最好但绝对水平仍低。这说明生物医学图文检索(尤其显微镜/病理)仍是开放难题;PMC-CLIP 的近乎零分提示跨域迁移失败(它在临床影像上训练,到病理检索上几乎无效)。
§7.3 BMC-CLIP 训练与结果
- 配方:OpenCLIP ViT-L-14 连续预训练,4×A100 × 36 epochs,6M 过滤子集,InfoNCE 损失,batch 8192,lr 1e-6,fp32,streaming。
- 相对 PMC-CLIP:分类 +24.67%,i2t R@100 +36.91%,t2i R@100 +34.6%。
- 相对 BiomedCLIP:8/10 子集更优,平均 +6.56%(dermatology 最高 +29.8%、ophthalmology +17.5%)。
- 效率:整体 10× less compute。
§7.4 BMC-SmolVLM 与 BMC-agent
- BMC-SmolVLM:SmolVLM 2.2B + LoRA,2×A100,10K 指令,LLaVA-Med 配方(<30 词 caption → 简述 prompt;>30 词 → 详述 prompt)。相对 RADFM(13B) +8.09%、相对 LMed-Flamingo(8B) +3.89%,与 LLaVA-Med(7B) 相当——用小得多的模型达到可比性能。
- BMC-agent:RAG 助手,协议沿 clinfo.ai;50 道指南题;4 个底座模型(DeepSeek-R1 70B / Qwen2-VL 72B / GPT-4o / Llama-3.3 70B);接入 BIOMEDICA Index 后平均 +36.22%。
§7.5 模型家族(HF)
| 模型 | 说明 |
|---|---|
| BMC_CLIP_CF | CLIP 连续预训练模型 |
| BMC-smolvlm1-256M / 500M / 2.2B | SmolVLM 三档 + LoRA |
| BMC-LongCLIP | 长文本 CLIP 变体(2026-03) |
§7.6 评测局限与引用守则
评测体系的三处结构性局限,引用其结果时须知:
- 套件样本量悬殊:Biomedica2025EvalSet 的 8 套件里,patchcamelyon(32,768)与 medmnist(21,963)样本充足,而 chexpert 仅 234 题、dresden 2,942 题——小套件上的排名受抽样误差支配,不宜作为强结论。
- 任务数口径不一:零样本分类任务在 v3 基准表是 35 项、摘要口径是 40 项(坑 4),"BIOMEDICA 在 N 项任务上如何"这句话本身就要先声明 N 的口径。
- 检索基准困难度高:BioMed-Flickr 上所有模型 R@1 都在个位数(§7.2),这样的绝对水平意味着"模型间差距"容易被随机波动淹没——比较时须报告置信区间或多 seed。
四条引用守则:
- 守则一(规模):引用 24,076,288 并注明"v1 附录统计表口径",不写 “over 24M”。
- 守则二(配方向):引用 BMC-CLIP 相对提升时,务必同时给出对比对象(vs PMC-CLIP 还是 vs BiomedCLIP),两者数字不同(§7.3)。
- 守则三(小套件):chexpert/dresden 等小套件的排名只作参考,不作正式模型优劣结论。
- 守则四(时点):模型榜是发布时点快照,新模型需在 Biomedica2025EvalSet(可自测)上另测,不能拿旧榜断言当前 SOTA。
§8 方法学启示
§8.1 "嵌入聚类 + 专家抽标 + 传播"是可复制的低成本标注范式
BIOMEDICA 最有复用价值的数字不是 24M,而是 24 标注小时。其成本结构:机器负责把相似图像聚到一起(DINOv2 + PCA + K-means),人类只在每簇的 30 张样本上做高价值判断(打 concept),最后用 hash map 把标签传播回整簇。任何"语料巨大、标注预算有限、且图像有可聚类结构"的团队都能照搬。三个前置条件:① 一个足够好的领域图像嵌入器;② 一个能覆盖数据分布的层级分类法;③ 可调度、能达成多数投票一致性的领域专家。复制时的红线:传播误差——簇内异质性是标签噪声的主要来源,复现者应披露簇纯度并做抽样质检,别把"24 小时搞定 24M"当成零成本神话。这一范式在 BIOMEDICA 的语料规模上是首次公开实证,方法论价值高于数据本身。
§8.2 全量覆盖 vs 精筛:语料定位决定一切
BIOMEDICA 的"全量包含一切图类型"是特性也是陷阱。它让数据集成为文献图-文对齐与科学图表理解的理想语料,但对医学影像任务,80%+ 的图表反而是噪声。这与 ROCO 的"从 PMC-OA 里精筛放射图"路线相反:ROCO 窄而纯,BIOMEDICA 宽而杂。启示:构建语料时先问"下游是谁"——若下游是通用医学多模态,全量 + 强元数据过滤能力(BIOMEDICA 的 27 字段 + concept 标签正是为此)比精筛更灵活。
§8.3 溯源字段是合并多源评测集的合规基石
Biomedica2025EvalSet 把 8 个第三方套件合并发放,每条样本保留 provenance_name/hub_id/url/license/citation 五件套。这是把多个来源、多种许可的数据打包时保障合规的最小必要设计:使用者可逐条追溯许可,发布者不必为混许可承担不透明责任。任何做"聚合基准"的团队都应把 provenance 字段列为硬性 schema,而非可选注释。
§8.4 双论文口径治理:登记而非统一
BIOMEDICA 横跨两篇 arXiv 论文(v1 框架论文 + v3 扩展论文)与一个 CVPR 正式版,数字在多处演化:22 vs 27 元数据字段、12 vs 13 global concepts、7 vs 8 标注者、35 vs 40 评测任务。没有单一权威口径。本条目的处理:主口径定"论文附录统计表(v1)",其余口径进附录 I 登记表,条目内凡涉该数字处均注明口径。检索者面对任何跨论文数据集,都应先建立这样的口径登记表再引用。
§9 与库内条目的关系
§9.1 家族图谱与互链清单
| 库内条目 | rid | 关系 | 互链方向 |
|---|---|---|---|
| pmc-oa(PMC-CLIP) | 320 | 同源 PMC,不同团队/论文/规模:1,646,592 子图级对(Zhang et al. arXiv:2303.07240);BIOMEDICA 为其约 14.6 倍 | 双向 |
| open-pmc(Open-PMC-18M) | 45 | 同源 PMC-OA 的对比数据集:18M 子图-caption 对;其论文明引 BIOMEDICA 为 prior work | 双向 |
| pmc-oa-subset | 360 | 同源 PMC OA 全文文献语料(无图文对产品形态) | 双向 |
| pmc-vqa(PMC-VQA) | 270 | 下游任务:文献图文问答基准;BIOMEDICA 可为其预训练上游 | 双向 |
| rex-in-the-wild | — | 直接下游:采样 32,982 张自 BIOMEDICA 的 non-commercial + Natural Images 切片 | 双向必链 |
| rexgradient-160k | 717 | 同领域影像语料(胸片),不同来源 | 双向 |
| roco | — | 同源 PMC-OA,非同数据集:ROCO 起始 6,031,814 对筛出约 82K 放射图 | 双向 |
| medicat / quilt-1m | 待核 | 同类图-注数据集(文献/病理),共同上游叙事 | 双向 |
| pathvqa / slake / vqa-rad / vqa-med / omnimedvqa | 260/250/240/280/290 | 医学 VQA 家族,可作 BIOMEDICA 预训练模型的下游评测 | 单向引用 |
| mimic-cxr / chexpert / medmnist | 待核 | 常见下游评测/对比数据 | 单向引用 |
§9.2 分工声明:BIOMEDICA 与 pmc-oa(320)、open-pmc(45)
三者都源自 PMC,检索时最易混。分工如下:
- pmc-oa / PMC-CLIP(rid 320):Zhang et al.(arXiv:2303.07240),子图级图文对 1,646,592(从 PMC-OA 中筛出的图文子集),HF
axiong/pmc_oa,偏临床影像训练。它是"PMC 图文"这一品类中较早、规模中等的一份。 - open-pmc / Open-PMC-18M(rid 45):Vector Institute / York University,Baghbanzadeh & Ashkezari et al.(arXiv:2506.02738,MICCAI 2026),18M 子图-caption 对,工程重点是 subfigure extraction(把多子图正确切分)以保证图文对齐保真度。其论文明确引用 BIOMEDICA 为 prior work:“bulk mining…e.g., PMC-15M and BIOMEDICA”。
- BIOMEDICA(本条目):Stanford,24,076,288 图像-图注对(全量、不限影像类型),差异化在 27 元数据字段 + 专家层级标注 + WebDataset 流式 + Index API。
一句话分工:pmc-oa 是"PMC 图文对的较早精筛版",open-pmc 是"重子图保真的 18M 版",BIOMEDICA 是"全量 24M + 专家标注 + 流式交付版"。三者上游同源(PMC-OA)但不同团队、不同论文、不同规模、不同侧重,不构成撞库;引用时各按各的论文与仓库。
§9.3 下游关系坐实:rex-in-the-wild
库内条目 rex-in-the-wild(ReXInTheWild)的 32,982 张采样图像取自 BIOMEDICA 的 “non-commercial + Natural Images” 切片(CVPR 2025, pp.19724-19735)——BIOMEDICA 是它的直接上游图文源。rex-in-the-wild 的 FACTS 已载明"BIOMEDICA 库内此前无 status=1 条目,互链走 pmc-oa/320 上游叙述",因此本条目发布后,两者应补双向挂链:rex-in-the-wild → 上游 BIOMEDICA;BIOMEDICA → 下游 rex-in-the-wild。这是本条目对库内关系网络的一个实质补全。
§9.4 ROCO 关系厘清
ROCO 起始于 PMC-OA 的 6,031,814 图-注对(随后筛出约 82K 放射图作为 ROCO 本体);BIOMEDICA 为全量 24M 覆盖。两者同源 PMC-OA 但非同一数据集,ROCO 是库内独立既有条目,互链走"共同上游 PMC-OA"叙事,不宣示父子关系。
§9.5 检索路径建议
- 从上游客量进:先读 pmc-oa(320) / open-pmc(45) 了解 PMC 图文家族的三种路线,再回本条目看 BIOMEDICA 的差分(全量 + 专家标注 + 流式)。
- 从下游应用进:读 rex-in-the-wild 条目了解它如何消费 BIOMEDICA 的采样切片。
- 从评测进:§7 结果 + Biomedica2025EvalSet / BioMedFlickr → 跨条目对比时统一"论文口径/实测口径"。
- 从许可进:§2.5 + §6.2 → 商业可行性直接看 commercial 分区实测。
§10 避坑清单:八个已踩过的坑
坑 1:"over 24M"是约数,不是 24,076,288。主库 README 原文写 “over 24M image-caption pairs and 30M image-references from 6M unique open-source articles”——全是约数;论文 v1 附录统计表的精确值是 24,076,288 图-注对 / 30,711,542 引用 / 6,042,494 文章。两个口径都对,但写论文引用时应给精确值并注明出自附录统计表;README 约数适合口头介绍。
坑 2:HF org 名与论文脚注不一致。v1 论文脚注曾指向 BIOMEDICA-NLP/BIOMEDICA(该 id 现已无效,API 返回 Invalid username or password);实际 org 为 BIOMEDICA,主 repo 为 BIOMEDICA/biomedica_webdataset_24M。用旧 id 检索会一无所获。引用一律用现行 repo id。
坑 3:元数据字段数与 global concepts 数多口径。① 元数据字段:v1 称 22、v3/README 称 27;② global concepts:v1 正文与 v3 写 12、v1 附录统计表写 13(且正文枚举里含 PCR,附录另有 Natural Images 行);③ Plots and Charts:表值 12,389,066 而正文称 “over 13 million / 57%”。引用时要么给区间,要么注明口径来源,别把两个数当同一个。
坑 4:35 vs 40 评测任务、30TB vs 27TB 存储。① 零样本分类任务数:v3 基准表 35 列 vs 摘要口径 40 tasks;② 存储:收集阶段 30TB vs HF 体量约 27TB——是"原始下载占用(含中间产物)"与"最终数据集体量"两个不同口径,不可互换。
坑 5:标注者人数 7 vs 8。v3 正文写 7 annotators;v1 附录写 2 clinical + 6 scientist = 8 人。差异可能源于统计时点或口径(是否含分类法开发者)。引用标注人力时说明口径,别断言"恰好 7 人"。
坑 6:主库 gated:auto,字段结构无法签署前预览。biomedica_webdataset_24M 为 gated:auto(须勾选数据使用协议 + 填用途),撰写时点无法直接抽样 tar 验证字段名。本条目 §4.1 字段字典据论文与 README 转写,非实测——签署后应先用 §6.1 的探查代码确认真实键名再写硬编码加载器。对照:Biomedica2025EvalSet 与 BioMedFlickr 为 gated:false,字段可实测(§4.2/§4.4 即实测口径)。
坑 7:图像类型极度不均衡,真影像仅约 17%。Plots and Charts 一类就占 12,389,066 张(约 51.5%),Microscopy + Clinical Imaging 合计约 17%。若不做 concept 过滤直接当"医学影像数据集"用,模型学到的主要是图表而非医学图像——任务错配的典型。做影像任务请直接用 4 类预滤子集或按 global_concept 过滤。
坑 8:商用与真影像两个诉求互相拉扯。约 65% 文章是商业可用许可(CC BY/CC0/CC BY-SA/CC BY-ND),但真影像在非商业文章中占比更高(13% vs 商业 5%),导致 commercial 分区里的临床/显微影像尤其稀疏。想在商业产品里用真影像,务必先在 commercial 分区实测目标 concept 的可用样本量,别假设"商用组 = 全类型都有"。
§11 总结
§11.1 三句话总结
- BIOMEDICA 用"PMC-OA 全量抽取 + 专家引导聚类标注"把 6,042,494 篇开放获取文献里的图-注对攒成 24,076,288 对的超大规模生物医学图文档案,是目前公开的最大规模医学图文预训练语料之一。
- 它的核心方法论价值在低成本标注范式(24M 图像仅 24 标注小时)与27 元数据字段 + 层级 concept 标签带来的强过滤能力;核心工程价值在 WebDataset 流式交付(免下 27TB)。
- 它的主要限制是图像类型高度不均衡(真影像约 17%)与无单一统一许可(三组逐条)——它适合做视觉-语言预训练与文献图-文对齐,但用于医学影像任务前必须按 concept 过滤,商用前必须逐条核查许可。
§11.2 适合谁
- 训练/微调生物医学视觉-语言模型的团队(CLIP 式对比预训练、VLM 指令微调);
- 研究科学文献图-文对齐、科学图表理解、规模定律的研究者;
- 想用 BIOMEDICA Index 构建医学 RAG 助手的产品/研究团队;
- 需要"大规模 + 强元数据过滤"能力的语料工程研究者;
- 做 PMC 图文家族横向对比(vs pmc-oa/open-pmc/ROCO/BiomedCLIP)的综述作者。
§11.3 不适合谁
- 只想做医学影像分类/分割、不想做过滤的团队——应直接用 4 类预滤子集或 ROCO/PMC-15M;
- 需要单一清晰许可、不能逐条核查的团队——BIOMEDICA 的三组异构许可会带来合规负担;
- 需要即插即用小规模数据的入门者——27TB 与 gated 流程都有门槛;
- 需要逐图级精确标签的任务——其标签是聚类传播所得,存在传播误差。
§11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 想快速跑通一个医学影像实验 | 取 4 类预滤 parquet 子集(gated:false 部分可即取),别碰全量主库 |
| 做生物医学 CLIP 式预训练 | 主库 streaming(§6.4)+ 按许可分组 + 按 concept 过滤 |
| 只要评测 | Biomedica2025EvalSet(89,941 题,gated:false)+ BioMedFlickr(检索) |
| 要商用 | 只用 commercial 分区,先实测目标 concept 可用量(坑 8) |
| 想复现 BMC-CLIP | 论文配方 4×A100×36ep、6M 过滤子集、batch 8192、lr 1e-6(§7.3) |
| 引用规模数字 | 用 24,076,288 并注明附录统计表口径,别用 “over 24M”(坑 1) |
| 做 RAG 医学问答 | 接 BIOMEDICA Index(§6.2 路径 3),协议参考 clinfo.ai |
§11.5 条目内快速锚点
| 要找 | 去处 |
|---|---|
| 多口径数字全表 | 坑 3/坑 4 + 附录 I 登记表 |
| gated 获取与 streaming 代码 | §6.1 / §6.4 |
| 图像类型分布 | §2.2 Table 16 |
| 评测结果 | §7.2 检索 + §7.3/§7.4 模型 |
| 库内分工声明 | §9.2(vs pmc-oa/open-pmc)/ §9.3(vs rex-in-the-wild) |
| 字段字典 | §4.1(主库,推断)/ §4.2(评测集,实测) |
FAQ(高频问答 32 问)
A. 基础认知
Q1:BIOMEDICA 是数据集、框架还是一个模型?
三合一但数据集实体真实存在:① ETL 框架(github.com/minwoosun/biomedica-etl);② 大规模图-文数据集(HF org BIOMEDICA,主库 24,076,288 图-注对,可流式下载);③ 模型家族(BMC-CLIP / BMC-SmolVLM / BMC-LongCLIP / BMC-agent)。判定依据不是论文自称的 “scalable, open-source framework”,而是 HF 上可验证的实体数据与模型仓库——证据见 §1.0。
Q2:名字 “BIOMEDICA” 怎么来的,容易和谁混?
取自 BIOMEDical Image-CAption,全大写。最易混的是 Microsoft 的 BiomedCLIP(其数据集 PMC-15M,约 15M 对,偏临床影像)——两者命名相近但团队、数据、规模、许可都不同(§2.3)。另有 ROCO、PMC-CLIP、Open-PMC 等 PMC 系数据集也易混(§9.2)。
Q3:谁做的?
Stanford University 主导(18/19 作者),Mayo Clinic 参与 1 位作者(Chia-Chun Chiang,负责指南问答评测);通讯作者 Alejandro Lozano / Min Woo Sun / Serena Yeung-Levy。Hugging Face(Daniel van Strien / Matthew Carrigan / Omar Sanseviero)协助上传与托管。
Q4:发表在哪?
两篇 arXiv 论文:v1 arXiv:2501.07171(2025-01-13,框架论文);扩展版 arXiv:2503.22727(v1 2025-03-26,v3 2026-09-16)。正式会议版:IEEE/CVF CVPR 2025,pp.19724-19735,DOI 10.1109/CVPR52734.2025.01837(Nashville 2025-06-11~15)。引用优先级:会议版 > v3 > v1。
Q5:数据在哪发布?
Hugging Face 组织 BIOMEDICA(10 个数据 repo + 5 个模型 repo)。主库 BIOMEDICA/biomedica_webdataset_24M(gated:auto);评测集与 BioMedFlickr(gated:false);4 类预滤子集各含 webdataset + parquet 两种格式。国内可用 hf-mirror.com 镜像。
Q6:它解决什么前人没解决的问题?
三个"做不到":① 规模——此前公开医学图文语料最大也就在百万到千万级(ROCO 8 万、Quilt-1M 百万、PMC-15M 一千五百万),BIOMEDICA 做到 2,400 万并全量覆盖;② 类型——不限临床影像,覆盖显微镜/图表/化学结构等文献全类型;③ 标注与交付——专家层级分类 + 27 元数据字段 + WebDataset 流式,让"巨大但可用"成为可能。
B. 数据与获取
Q7:数据到底多大?
主库 HF 标签 size_categories n>1T;收集阶段占 30TB 存储,HF 最终体量约 27TB。两个数字口径不同(坑 4)。README 鼓励用 streaming 免本地下载。
Q8:怎么下载,要下多少?
不要整库下载。三层路径(§6.2):① streaming(推荐,边训边读);② 下载元数据/标签后按条件取特定 tar 分片;③ 用 BIOMEDICA Index 检索 API。单 tar 为 10,000 对。
Q9:gated 怎么签?
主库 gated:auto——HF 账号登录后,勾选数据使用协议(extra_gated_prompt,三组 PMC 许可声明)并填写用途即可获 token。评测集与 BioMedFlickr 是 gated:false,无需申请。gated 授权在 HF 侧完成,镜像站只是加速下载。
Q10:能商用吗?
分三组(§2.5):Commercial(CC0/CC BY/CC BY-SA/CC BY-ND,约 65% 文章)、Non-commercial(CC BY-NC 系)、Other(无机器可读 CC)。商业产品只能用 commercial 分区,且须逐条遵守源文章 CC 许可。注意商用组里真影像稀少(坑 8)。
Q11:数据格式是什么?
主库为 WebDataset(tar 分片,每片 10,000 对,按 commercial/non-commercial/other 分区);评测集与预滤子集为 Parquet(支持 datasets 库与 Croissant 元数据)。
Q12:能预览字段吗?
主库 gated:auto,撰写时点无法直接抽样(坑 6)——字段名据论文/README 转写。但 Biomedica2025EvalSet(19 字段)与 BioMedFlickr(11 字段)为 gated:false,字段可实测(§4.2/§4.4)。
C. 统计与构成
Q13:图-注对的精确数是多少?
24,076,288(v1 附录统计表)。README 写 “over 24M”(约数)。引用给精确值并注口径(坑 1)。
Q14:文章数、含图/纯文本怎么分?
文章总数 6,042,494:含图 5,050,473 + 纯文本 992,021。平均每篇 4.9 图。
Q15:图-正文引用有多少?
30,711,542 条(单条最长 699,117 tokens,中位 338)。README 约数 “30M image-references”。
Q16:图像类型是怎么分布的?
Plots and Charts 12,389,066(约 51.5%,最多);Illustrative Diagrams 2,919,995;Microscopy 2,517,332;Clinical Imaging 1,928,158;Chemical Structures 1,128,082;Immuno Assays 904,632;Tables 639,029;其余 Maps/Tools/PCR/Equations 各数十万至数万(详见 §2.2 Table 16)。
Q17:真影像占多少?
Microscopy + Clinical Imaging 合计 4,445,490,约 17%。其余八成以上是图表类(坑 7)。
Q18:分类法有多少类?
12 global concepts / 170 local concepts(正文口径;v1 附录表写 13,见坑 3)。覆盖 23,271,916 图(96.7%)。
Q19:元数据字段有多少?
v1 称 22、v3/README 称 27(坑 3)。含 PMid、publication date、citation、journal、license、title、abstract、MeSH terms、keywords、citing references 等。
Q20:文本量多大?
图注共 2.84×10⁹ tokens(单条 1~12,389,中位 64);全文共 6.65×10¹⁰ tokens。
Q21:图像尺寸范围?
中位宽 709 × 高 476 px;最大 52,490 × 65,081 px。跨度从缩略图到整页大图(§2.4)。
D. 标注与流水线
Q22:标签怎么打出来的?
专家引导流水线(§3.6):DINOv2 嵌入 → PCA 25 主成分 → K-means K=2000 过聚类 → 7 名标注者每 cluster 抽 30 张 → 打 global+local concept → 多数投票(平票重评)→ 按 cluster ID 传播至全簇。
Q23:"24 标注小时"是真的吗?
论文如此宣称(7 名专家合计 24 小时覆盖 24M 图像)。它的含义是人类总投入工时,不含机器嵌入/聚类/传播的计算时间;且标签是聚类级传播而非逐图判断,存在传播误差(§8.1)。引用时保留分寸。
Q24:谁标注的?
v3 口径 7 名 annotators(clinicians + scientists);v1 附录 2 clinical + 6 scientist = 8 人(坑 5)。
Q25:标签可靠性如何?
多数投票 + 平票重评提供了簇内一致性保障,但簇纯度有限,标签是"聚类级真相"而非"逐图真相"。对标签精度敏感的任务应自行抽样复标校准(§5.4/§8.1)。
Q26:panel-type 是什么?
图像级字段,标注 single-panel(单图)还是 multi-panel(多面板拼图)。文献图常为多面板,影响图文对齐粒度。
E. 模型与评测
Q27:由它训练了哪些模型?
BMC-CLIP(OpenCLIP ViT-L-14 连续预训练)、BMC-SmolVLM(256M/500M/2.2B + LoRA)、BMC-LongCLIP(长文本变体)、BMC-agent(RAG 助手)。对应 HF 5 个模型 repo(§7.5)。
Q28:BMC-CLIP 效果如何?
相对 PMC-CLIP 分类 +24.67%、检索 R@100 +34.6%~36.91%;相对 BiomedCLIP 8/10 子集更优、平均 +6.56%;整体 10× less compute(§7.3)。
Q29:BioMed-Flickr 检索难吗?
很难。所有模型 R@1 都是个位数——BMC-CLIP 最好(i2t 4.13 / t2i 4.15),OpenCLIP 2.78,PMC-CLIP 近乎零分(0.03,跨域失败)(§7.2)。
Q30:评测体系有多大?
零样本分类 35~40 项(口径不一,坑 4)、BioMed-Flickr 检索、VQA 四件套(VQA-RAD/SLAKE/PathVQA/PMC-VQA)、50 题指南问答。评测集 Biomedica2025EvalSet 8 套件共 89,941 题(§4.3)。
F. 库内关系与复现
Q31:和 pmc-oa(320)、open-pmc(45) 什么关系,会撞库吗?
不撞库。三者同源 PMC-OA 但不同团队/论文/规模:pmc-oa 1,646,592 子图对、open-pmc 18M 子图-caption 对(明引 BIOMEDICA 为 prior work)、BIOMEDICA 24M 全量。分工见 §9.2。
Q32:和 rex-in-the-wild 什么关系?
BIOMEDICA 是其直接上游图文源——rex-in-the-wild 的 32,982 张采样图像取自 BIOMEDICA 的 non-commercial + Natural Images 切片(§9.3)。本条目发布后应补双向挂链。
事实清单(硬事实 36 条)
- BIOMEDICA 全称 “BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature”(arXiv:2501.07171 标题)。
- 首发 arXiv:2501.07171 v1,2025-01-13(cs.CV + cs.CL,arXiv API 实测)。
- 扩展论文 arXiv:2503.22727 v1 2025-03-26 / v2 2025-04-01 / v3 2026-09-16(cs.CL + cs.LG,19 作者,API 实测 v3 更新日)。
- 正式发表于 IEEE/CVF CVPR 2025,pp.19724-19735,DOI 10.1109/CVPR52734.2025.01837,Nashville 2025-06-11~15(Crossref 实测出版日 2025-06-10)。
- DBLP 条目
DBLP:conf/cvpr/LozanoSB0NGLARK25;CVPR 2025 poster 编号 33761。 - 团队:Stanford University 主导(18/19 作者)+ Mayo Clinic(Chia-Chun Chiang);通讯 Alejandro Lozano / Min Woo Sun / Serena Yeung-Levy。
- 唯一图像-图注对 24,076,288(v1 附录统计表)。
- 图-正文行内引用 30,711,542(v1 附录统计表;v3 口径 “30 million in-line references”)。
- 文章总数 6,042,494 = 含图 5,050,473 + 纯文本 992,021。
- 平均每篇 4.9 图;每图 1.6 条 figure reference。
- 图注文本共 2.84×10⁹ tokens(单条 1~12,389,中位 64);全文共 6.65×10¹⁰ tokens。
- Figure reference 单条最长 699,117 tokens,中位 338。
- 图像中位 709×476 px;最大 52,490×65,081 px。
- 收集:NCBI FTP(ftp.ncbi.nlm.nih.gov/pub/pmc/oa_package)下载 81 天(2024-07-02 ~ 09-20),占 30TB;HF 体量约 27TB。
- 数据序列化为 WebDataset tar,每片 10,000 对(沿用 OpenCLIP 命名约定),按 commercial/non-commercial/other 三组许可分区。
- 分类法:12 global concepts / 170 local concepts(正文口径;v1 附录表写 13,坑 3),覆盖 23,271,916 图(96.7%)。
- 标注流水线:DINOv2(ViT-L-14 distilled)嵌入 → PCA 25 主成分 → K-means K=2000 → 7 名标注者每 cluster 抽 30 张 → 多标签 concept → 多数投票(平票重评)→ cluster 传播。
- 标注效率宣称:24M 图像仅用 24 标注小时(7 名专家合计)。
- 标注者口径:v3 写 7 人;v1 附录写 2 clinical + 6 scientist(8 人)——坑 5。
- global concept 图像数(Table 16):Plots and Charts 12,389,066;Illustrative Diagrams 2,919,995;Microscopy 2,517,332;Clinical Imaging 1,928,158;Chemical Structures 1,128,082;Immuno Assays 904,632;Tables 639,029;Maps 324,265;Tools and Materials 272,399;PCR 35,353;Equations 28,888。
- Biomedical(microscopy + clinical imaging)占比约 17%;非商业文章中占比(13%)高于商业(5%)/other(6%)。
- 许可分布(v1 Table 17):CC BY 3,795,419;CC BY-NC 771,755;CC BY-NC-ND 642,982;Other 414,857;CC0 132,592;CC BY-NC-SA 275,638;CC BY-ND 7,900;CC BY-SA 1,287。
- 许可三组(PMC 口径):Commercial allowed(CC0/CC BY/CC BY-SA/CC BY-ND)、Non-commercial only(CC BY-NC 系)、Other。
- 主库 HF repo
BIOMEDICA/biomedica_webdataset_24M,gated:auto,2,885 downloads / 40 likes,size_categories n>1T,lastModified 2026-09-02(hf-mirror API 实测 2026-09-30)。 - HF 组织
BIOMEDICA共 10 个数据 repo(主库 + 4 类预滤子集 × webdataset/parquet + 评测集 + BioMedFlickr)。 - 4 类预滤子集:histopathology(39 dl)、microscopy(110 dl)、dermatology(12 dl)、surgery(5 dl);对应 parquet 版 5/27/5/2 dl。
- Biomedica2025EvalSet:gated:false,license:other,667 dl,download_size 2,054,180,939 字节,test 89,941 题,9 configs。
- EvalSet 8 套件样本数:cataracts 7,000 / chexpert 234 / dresden 2,942 / lc25000 3,750 / medmnist 21,963 / patchcamelyon 32,768 / rsna 3,969 / ubench 17,315。
- EvalSet 19 字段含 provenance 五件套:provenance_name / provenance_hub_id / provenance_url / provenance_license / provenance_citation。
- BioMedFlickr:gated:false,7,185 行(test),download_size 906,819,144 字节,字段 image/caption/caption_raw/title/flickr_id/url/nsid/category/tags/width/height;镜像
Alejandro98/BioMedFlickr。 - BioMed-Flickr 检索:BMC-CLIP i2t 4.13/15.13/38.30、t2i 4.15/13.75/36.10;BiomedCLIP 3.70/12.78/36.27 与 3.94/13.63/35.63;PMC-CLIP 0.03/0.13/1.39;OpenCLIP 2.78/9.78/26.75。
- BMC-CLIP 配方:OpenCLIP ViT-L-14 连续预训练,4×A100×36 epochs,6M 过滤子集,InfoNCE,batch 8192,lr 1e-6,fp32,streaming;vs PMC-CLIP 分类 +24.67%、i2t R@100 +36.91%、t2i R@100 +34.6%;vs BiomedCLIP 8/10 子集更优、平均 +6.56%;10× less compute。
- BMC-SmolVLM:SmolVLM 2.2B + LoRA,2×A100,10K 指令,LLaVA-Med 配方;vs RADFM(13B) +8.09%、vs LMed-Flamingo(8B) +3.89%。
- BMC-agent:RAG 协议沿 clinfo.ai,50 道指南题(neurology/molecular pathology/pharmacogenomics,≤2023-01 知识,double board-certified pathologist 设计),4 底座(DeepSeek-R1 70B / Qwen2-VL 72B / GPT-4o / Llama-3.3 70B),接入 Index 后平均 +36.22%。
- 模型 repo:BMC_CLIP_CF、BMC-smolvlm1-256M/500M/2.2B、BMC-LongCLIP(2026-03)。
- ETL 代码 github.com/minwoosun/biomedica-etl;CLIP 训练 github.com/Ale9806/open_clip_with_biomedica;官网 https://minwoosun.github.io/biomedica-website(HF README 给出,GitHub Pages,沙箱不可达)。
术语表(30 条)
| # | 术语 | 释义 |
|---|---|---|
| 1 | BIOMEDICA | 本条目数据集;BIOMEDical Image-Caption 全大写缩写 |
| 2 | PMC-OA | PubMed Central Open Access Subset,美国国立医学图书馆的开放获取文献子集 |
| 3 | image-caption pair | 图像-图注对;本数据集的记录粒度 |
| 4 | figure reference | 图-正文行内引用;正文中指向某图的文字引用 |
| 5 | WebDataset | 基于 tar 分片的流式数据格式,把同 key 文件打包成一条记录 |
| 6 | shard | 分片;本数据集每片含 10,000 图像-图注对 |
| 7 | streaming | 流式加载;边读边训,免本地下载全量 |
| 8 | global concept | 分类法第一层,12 类图像大类(如 Plots and Charts) |
| 9 | local concept | 分类法第二层,170 类细粒度标签 |
| 10 | panel-type | 图像级字段:single-panel / multi-panel |
| 11 | DINOv2 | Meta 自监督视觉基础模型,用作本数据集图像嵌入器(ViT-L-14 distilled) |
| 12 | 过聚类(over-clustering) | K-means K=2000,聚出远多于真实类别的簇以提升纯度 |
| 13 | PCA | 主成分分析;把 DINOv2 嵌入降到 25 维 |
| 14 | 多数投票 | 簇内 30 张样本的标签投票定簇标签(平票重评) |
| 15 | 标签传播 | 用 hash map 按 cluster ID 把簇标签分派给全簇图像 |
| 16 | BMC-CLIP | 由 BIOMEDICA 训练的 CLIP 式模型(OpenCLIP ViT-L-14 连续预训练) |
| 17 | BMC-SmolVLM | 由 BIOMEDICA 微调的 SmolVLM(256M/500M/2.2B + LoRA) |
| 18 | BMC-LongCLIP | 长文本变体 CLIP 模型(2026-03) |
| 19 | BMC-agent | 基于 BIOMEDICA Index 的检索增强生成(RAG)医学助手 |
| 20 | BIOMEDICA Index | 混合向量-文本检索 API(ChromaDB + BM25s) |
| 21 | RAG | Retrieval-Augmented Generation,检索增强生成 |
| 22 | InfoNCE | 对比学习损失函数;CLIP 式训练常用 |
| 23 | 连续预训练(continual pretraining) | 在已有预训练权重上继续用领域数据训练 |
| 24 | LoRA | 低秩适配微调方法,用小参数量适配大模型 |
| 25 | zero-shot classification | 零样本分类;不微调直接用模型分类 |
| 26 | R@K | Recall@K 检索指标;前 K 个结果是否命中 |
| 27 | i2t / t2i | image-to-text / text-to-image 检索方向 |
| 28 | Croissant / mlcroissant | 数据集元数据标准(MLCommons),本数据集 parquet 子集支持 |
| 29 | gated dataset | 需登录并勾选协议方可下载的 HF 发布形式;主库为 gated:auto |
| 30 | DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability 五维数据集评估框架 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | BIOMEDICA |
| url_name | biomedica |
| 类型 | 大规模图文档案 + ETL 框架 + 模型家族(三件套) |
| 论文 | CVPR 2025(DOI 10.1109/CVPR52734.2025.01837);arXiv:2501.07171 与 arXiv:2503.22727 |
| 团队 | Stanford University(主导)× Mayo Clinic;HF 托管 |
| 规模 | 24,076,288 图-注对 × 6,042,494 文章(口径见坑 1) |
| 许可 | 无统一许可;逐条沿承 PMC-OA CC,分 commercial/non-commercial/other 三组 |
| 抓取时点 | 2026-09-30 |
| URL 占位 | https://www.qianfanghub.com/ai-ready-dataset/biomedica/734 |
| 库内互链 | rex-in-the-wild(下游)·pmc-oa(320)·open-pmc(45)·pmc-oa-subset(360)·pmc-vqa(270)·rexgradient-160k(717)·roco·medicat |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 双 arXiv + CVPR DOI + HF org 明确;但论文脚注旧 org id 失效(坑 2)轻微干扰检索 |
| A 可获取性 | 6 | 主库 gated:auto + 27TB 体量;但评测集/子集/BioMedFlickr gated:false 与 streaming 是强补偿 |
| I 可互操作 | 7 | WebDataset 通用格式 + Parquet 子集含 Croissant;27 字段强过滤;扣分于主库字段签署前不可预览(坑 6) |
| M 元数据质量 | 8 | 27 元数据字段 + 专家层级分类 + panel-type;但元数据字段数 22/27、global 12/13 等多口径(坑 3)扣分 |
| S 可持续性 | 7 | HF 长期托管 + ETL 开源 + 增量管线;扣分于无统一许可带来的长期合规维护负担 |
| 综合评级 | 7.2/10(良) | 规模、元数据、方法论均优;获取门槛与许可异构是主要摩擦,适合研究团队而非即插即用 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置/方式 |
|---|---|---|
| CVPR 2025 pp.19724-19735 / DOI | IEEE/CVF CVPR 2025 论文集 | Crossref API 实测(2026-09-30) |
| arXiv:2501.07171(2025-01-13)标题 | arXiv API | 实测标题与 published 字段 |
| arXiv:2503.22727(2025-03-26,v3 2026-09-16) | arXiv API | 实测 published/updated |
| 24,076,288 图-注对 / 6,042,494 文章 | 论文 v1 附录统计表 | 论文正文转写 |
| 主库 2,885 dl / 40 likes / gated:auto / n>1T | HF API | hf-mirror api/datasets/BIOMEDICA/biomedica_webdataset_24M |
| EvalSet 89,941 / 2,054,180,939 B / 9 configs | HF API + cardData | hf-mirror 实测 |
| BioMedFlickr 7,185 / 906,819,144 B / gated:false | HF API | hf-mirror 实测 |
| HF org 10 数据 repo 清单与下载数 | HF API | hf-mirror 全量盘点 |
| Table 16 各 concept 图像数 | 论文 v1 Table 16 | 论文正文转写 |
| BioMed-Flickr 检索分数 | 论文 v3 结果表 | 论文正文转写 |
| README “over 24M…” 原文 | 主库数据集卡 description | hf-mirror API description 字段实抓 |
附录 D:数据获取决策树
需求是什么?
├── 只想"看看长什么样"
│ └── BioMedFlickr / EvalSet(gated:false)直接 load_dataset;主库字段签署后探查(坑 6)
├── 做生物医学 CLIP 式预训练
│ ├── 1) HF 勾选主库 gated 协议 → 取 token
│ ├── 2) 按 commercial/non-commercial/other 选分区
│ ├── 3) 按 global concept 过滤(去图表)→ streaming 读取
│ └── 4) 按文章 ID 切分,防泄漏(§5.2)
├── 做医学影像任务(分类/分割)
│ └── 直接用 4 类预滤子集(histopathology/dermatology/surgery/microscopy)
├── 商业用途
│ └── 仅 commercial 分区;先实测目标 concept 可用量(坑 8),逐条核查 CC
├── 要评测
│ └── Biomedica2025EvalSet(8 套件 89,941 题)+ BioMedFlickr(检索)
└── 做 RAG 医学问答
└── 接 BIOMEDICA Index(§6.2 路径 3),协议参考 clinfo.ai
附录 E:图像类型与任务匹配表
| global concept | 图像数 | 适配任务 | 备注 |
|---|---|---|---|
| Plots and Charts | 12,389,066 | 图表理解、数据提取 | 占比最大(约 51.5%),非医学影像 |
| Illustrative Diagrams | 2,919,995 | 示意图理解、图文对齐 | 非医学影像 |
| Microscopy | 2,517,332 | 病理/显微图像分类、检索 | 真影像,医学相关 |
| Clinical Imaging | 1,928,158 | 临床影像分类 | 真影像,医学相关 |
| Chemical Structures | 1,128,082 | 化学信息学、分子识别 | 非医学影像 |
| Immuno Assays | 904,632 | 免疫检测图像理解 | 真影像,实验类 |
| Tables | 639,029 | 表格理解、信息抽取 | 非影像 |
| Maps | 324,265 | 空间信息 | 非医学 |
| Tools and Materials | 272,399 | 器材识别 | 非医学 |
| PCR | 35,353 | 分子生物学 | 真影像/凝胶图 |
| Equations | 28,888 | 公式识别 | 非影像 |
附录 F:低成本标注流水线复现骨架(SOP 模板)
阶段 0 前置(周级)
- 领域图像嵌入器(如 DINOv2 微调版)
- 层级分类法草案(global + local,含定义与示例)
- 专家资源排期(目标:达成多数投票一致性)
阶段 1 机器侧(计算主导)
- 全量图像过嵌入器 → 得到向量
- PCA 降维(本数据集用 25 维)
- K-means 过聚类(K 取真实类别数的数倍,本数据集 2000)
阶段 2 人工侧(人力主导)
- 每 cluster 随机抽 30 张
- 专家打 global + local 多标签
- 多数投票定簇标签;平票样本重评
阶段 3 传播与质检
- 按 cluster ID hash map 传播标签到全簇
- 抽样复标测簇纯度;披露传播误差(本数据集未充分披露——补上这一课)
- 计算覆盖率(本数据集 96.7%)
阶段 4 交付治理
- 元数据字段冻结为 schema(本数据集 27 字段)
- 按许可分组分区(commercial/non-commercial/other)
- WebDataset 分片(每片 10,000 对)
- 建立检索 API(向量 + 稀疏混合)
附录 G:BMC 模型家族对照表
| 模型 | 底座 | 训练配置 | 关键相对结果 |
|---|---|---|---|
| BMC-CLIP | OpenCLIP ViT-L-14(连续预训练) | 4×A100×36ep,6M 过滤子集,InfoNCE,batch 8192,lr 1e-6 | vs PMC-CLIP 分类 +24.67%;vs BiomedCLIP 平均 +6.56% |
| BMC-SmolVLM-256M/500M/2.2B | SmolVLM + LoRA | 2×A100,10K 指令,LLaVA-Med 配方 | vs RADFM(13B) +8.09%;vs LMed-Flamingo(8B) +3.89% |
| BMC-LongCLIP | 长文本 CLIP 变体 | 2026-03 发布 | 长图注场景 |
| BMC-agent | RAG 助手(4 底座) | 协议沿 clinfo.ai;接入 Index | 指南问答平均 +36.22% |
附录 H:许可与合规速查
| 许可组 | 含 CC 类型 | 可用场景 | 官方目录 |
|---|---|---|---|
| Commercial allowed | CC0 / CC BY / CC BY-SA / CC BY-ND | 商业与研究(须署名,ND 禁改) | commercial/ |
| Non-commercial only | CC BY-NC / CC BY-NC-SA / CC BY-NC-ND | 仅非商业 | non-commercial/ |
| Other | 无机器可读 CC / 自定义 | 逐条核查 | other/ |
红线:① 跨组混合后商用 = 违规;② 抹除署名 = 违规;③ 假设"商用组 = 全类型齐备" = 高风险(真影像在商用组稀少,坑 8);④ 使用前逐条核对源文章 license 字段。
附录 I:多口径登记表
| # | 项 | 口径 A(主) | 口径 B | 口径 C | 处理 |
|---|---|---|---|---|---|
| 1 | 图文对规模 | 24,076,288(v1 附录统计表) | “over 24M”(README 约数) | — | 引用用 A,口头介绍可用 B |
| 2 | 元数据字段数 | 22(v1) | 27(v3 + README) | — | 注明所得来源版本 |
| 3 | global concepts 数 | 12(正文/v3) | 13(v1 附录表) | — | 用 A,B 存照 |
| 4 | 标注者人数 | 7(v3 正文) | 8 = 2+6(v1 附录) | — | 注明口径 |
| 5 | Plots and Charts | 12,389,066(表值) | “over 13 million / 57%”(正文) | — | 用表值 A,正文存照 |
| 6 | 存储 | 30TB(收集阶段) | 27TB(HF 体量) | — | 不同口径,不可互换 |
| 7 | 评测任务数 | 35(v3 基准表) | 40(摘要) | — | 注明口径 |
| 8 | 官网 | minwoosun.github.io/biomedica-website(README) | biomedica-ai.github.io(首轮误记) | — | 用 A |
| 9 | 旧 org id | BIOMEDICA-NLP/BIOMEDICA(v1 脚注,已失效) | BIOMEDICA(现行) | — | 用 B |
附录 J:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 新版本发布 | arXiv 出 v4 / HF 主库大改 | §1.4 时间轴与 §4 数据规模复核 | 1 |
| 许可变更 | PMC-OA 许可体系或 HF gated 条款更新 | §2.5/附录 H 重写 | 2 |
| rex-in-the-wild 落库 | 其条目 status=1 | 补双向挂链(§9.3) | 3 |
| 字段实测 | 签署后抽样主库 tar | §4.1 升级为实测口径 | 4 |
| 新评测套件 | EvalSet 增 config | §4.3 表更新 | 5 |
| 模型家族扩张 | 新 BMC-* repo 上线 | 附录 G 更新 | 6 |
附录 K:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | 双 arXiv + CVPR DOI + HF repo |
| F2 富元数据 | ✅ | 27 字段 + 层级分类 + panel-type |
| A1 可访问协议 | ⚠️ | 主库 gated:auto;评测集/子集/BioMedFlickr 开放 |
| A2 元数据可访问 | ✅ | 论文/数据卡/README 公开可读 |
| I1 互操作格式 | ✅ | WebDataset(通用)+ Parquet(含 Croissant) |
| I2 词汇表引用 | ✅ | 自建 concept 分级分类法 |
| R1 来源溯源 | ✅ | PMC-OA 谱系明确;EvalSet 带 provenance 五件套 |
| R3 可复现流程 | ⚠️ | ETL 开源,但标注传播误差未充分披露 |
| AI-Ready 综合 | 良 | 规模与元数据优、流式交付强;gated 与许可异构是中摩擦 |
附录 L:缩写速查
| 缩写 | 全称 |
|---|---|
| PMC / PMC-OA | PubMed Central / PMC Open Access Subset |
| CLIP | Contrastive Language-Image Pretraining |
| VLM | Vision-Language Model |
| VQA | Visual Question Answering |
| RAG | Retrieval-Augmented Generation |
| BM25 | Best Matching 25(稀疏检索算法) |
| PCA | Principal Component Analysis |
| LoRA | Low-Rank Adaptation |
| InfoNCE | Information Noise-Contrastive Estimation |
| CVPR | IEEE/CVF Conference on Computer Vision and Pattern Recognition |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| DUO | Data Use Ontology |
附录 M:基于本数据集的研究检查清单(12 项)
- 许可核对:用途是否落在所取目录分区的 CC 范围内?跨组混用即止。
- concept 过滤:医学影像任务是否已过滤掉图表类?(真影像仅约 17%)
- 文章级切分:训练/验证是否按 PMid 切分,而非按图像?(§5.2)
- 去重核验:与下游评测集是否有图像级重叠?(§5.4)
- 字段实证:主库字段名以签署后抽样为准(坑 6),不用论文描述硬编码。
- 规模口径:引用 24,076,288 而非 “over 24M”(坑 1)。
- 商用量实测:commercial 分区内目标 concept 样本量是否足用?(坑 8)
- 标注兜底:对标签精度敏感的任务,自行抽样复标(§8.1)。
- 流式训练:用 streaming 而非整库下载(27TB)。
- 模型复现:BMC-CLIP 配方(§7.3)须逐项对齐(batch 8192 / lr 1e-6 / 36ep)。
- 检索评测:BioMed-Flickr 的 R@K 绝对值低,跨模型对比须控制变量。
- 时点存照:HF 下载数等为抓取快照,引用注明日期(本条目基准时点 2026-09-30)。
附录 N:主库字段字典(论文口径,签署前推断版)
| 字段(语义) | 类型(推断) | 取值域 | 依据 |
|---|---|---|---|
| image | ImageObject | 图像原文 | README/论文 |
| caption | Text | 英文图注 | 论文方法 |
| figure_references | Text[] | 图-正文引用 | 论文附录 |
| global_concept | Label | 12 类 | §2.1 |
| local_concept | Label | 170 类 | §2.1 |
| panel_type | Label | single/multi | 论文方法 |
| license_group | Label | commercial/non-commercial/other | 分区目录 |
| 文章级 27 字段 | mixed | PMid/date/citation/journal/license/title/abstract/MeSH/keywords/… | 论文方法 |
升级路径:本表为签署前推断版(坑 6);签署后实测字段名/类型/嵌套结构后按附录 J 触发点 4 升级。自检建议:抽样应能复现 Table 16 的 concept 分布形状与 96.7% 覆盖率。
附录 O:引文规范
@inproceedings{lozano2025biomedica,
title = {BIOMEDICA: An Open Biomedical Image-Caption Archive,
Dataset, and Vision-Language Models Derived from Scientific
Literature},
author = {Lozano, Alejandro and Sun, Min Woo and Burgess, James and
others},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision
and Pattern Recognition (CVPR)},
pages = {19724--19735},
year = {2025},
doi = {10.1109/CVPR52734.2025.01837}
}
@article{lozano2025biomedicaarxiv,
title = {BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset,
and Vision-Language Models Derived from Scientific Literature},
author = {Lozano, Alejandro and Sun, Min Woo and Burgess, James and
others},
journal = {arXiv preprint arXiv:2501.07171},
year = {2025}
}
@article{lozano2025large,
title = {A Large-Scale Vision-Language Dataset Derived from Open
Scientific Literature to Advance Biomedical Generalist AI},
author = {Lozano, Alejandro and Sun, Min Woo and Burgess, James and
others},
journal = {arXiv preprint arXiv:2503.22727},
year = {2025}
}
附录 P:检索路径示范(关键词组合与查询式)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 本体论文 | “BIOMEDICA” OR arXiv:2501.07171 OR doi:10.1109/CVPR52734.2025.01837 | arXiv/CVPR 页 |
| 数据仓库 | HF API datasets?author=BIOMEDICA | HF org 10 个数据 repo |
| 主库 | huggingface.co/datasets/BIOMEDICA/biomedica_webdataset_24M | 主库页面 |
| 模型家族 | HF models?author=BIOMEDICA | BMC-* 模型 |
| ETL 代码 | github minwoosun biomedica-etl | ETL 仓库 |
| 下游关系 | “rex-in-the-wild” BIOMEDICA | rex-in-the-wild 论文 |
| PMC 家族对比 | PMC-OA image-caption dataset PMC-CLIP open-pmc | 同源文献 |
| 反例(勿用) | 旧 org “BIOMEDICA-NLP/BIOMEDICA” 直搜 | 会命中的是失效 id(坑 2) |
检索卫生两条:一、认准 repo id BIOMEDICA/biomedica_webdataset_24M(旧 id 已失效);二、别把 “over 24M” 当精确值引用(坑 1)。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 arXiv:2501.07171、arXiv:2503.22727、IEEE/CVF CVPR 2025 正式版(DOI 10.1109/CVPR52734.2025.01837)与 HuggingFace 组织 BIOMEDICA 的仓库 API 实测(hf-mirror,2026-09-30)为源;元数据字段数 22/27、global concepts 12/13、标注者 7/8、Plots and Charts 表值 vs 正文、30TB vs 27TB、35 vs 40 任务等原始文档口径差异已在坑点与附录 I 存照。主库 gated:auto 导致字段结构无法签署前实测(坑 6),字段字典(§4.1/附录 N)为论文与 README 口径的推断版。条目与库内 rex-in-the-wild(直接下游)、pmc-oa(320)、open-pmc(45)、pmc-oa-subset(360)、pmc-vqa(270)、rexgradient-160k(717)、ROCO 等条目互链,构成 PMC 图文语料家族与生物医学多模态预训练生态的完整检索面。后续维护触发点见附录 J。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- quilt-1m — 共享标签:医学影像 / 多模态 / 影像-文本对齐
- medicat — 共享标签:多模态 / 影像-文本对齐 / 生物医学文献
- pmc-oa — 共享标签:多模态 / 影像-文本对齐 / 生物医学文献
- openi — 共享标签:医学影像 / 影像-文本对齐 / 评测基准
- roco — 共享标签:医学影像 / 多模态 / 影像-文本对齐
- skincap — 共享标签:多模态 / 影像-文本对齐 / 图像分类
- derm1m — 共享标签:多模态 / 影像-文本对齐 / 评测基准
- ms-cxr-t — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
- vlm3d — 共享标签:医学影像 / 多模态 / 影像-文本对齐 / 评测基准
- padchest — 共享标签:医学影像 / 多模态 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

