INFOBOX
|
|
| 数据集名称 |
Open-PMC-18M |
| 英文全称 |
Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning |
| 别名 / 简称 |
Open-PMC、OPMC-18M、PMC-18M |
| 疾病分类 |
多模态覆盖。核心映射:2A00–2B9F 感染性疾病 / 2A90–2A9Y 肿瘤影像 / XH1V1 病理形态学 / MD90–MD9Y 眼科影像 / XD90–XD9Y 皮肤科影像 |
| SNOMED CT |
118222006 Microscopy (procedure) / 363679005 Imaging technique (qualifier value) / 19851009 Acquired abnormality of skin (disorder) / 363378007 Pathology report (record artifact) |
| 数据模态 |
多模态(图像 + 文本);图像子模态:放射学(CT/MRI/X-ray)、显微镜学(病理切片/细胞学)、可见光摄影(皮肤/内镜) |
| AI 任务类型 |
跨模态检索、零样本分类、线性探测、视觉-语言对比学习、子图检测与提取、图像表征学习 |
| 样本总数 |
18,000,000 个子图-标题对(从约 32,000,000 个分解子图中过滤获得) |
| 数据大小 |
~8 TB(估计,含图像+标题文本) |
| 数据格式 |
Parquet(HuggingFace)/ PNG-JPEG(图像)/ JSON(标题与元数据)/ PyTorch checkpoint(预训练模型) |
| 许可证 |
PMC Open Access Subset 多许可证混合(CC BY / CC BY-SA / CC BY-NC 等,逐条标注);代码与模型:Apache 2.0 |
| 访问级别 |
开放(HuggingFace 直接下载) |
| DUO 标签 |
NRES |
| 语言 |
英文(文献标题与正文引用) |
| 首发日期 |
2025-03-03(arXiv:2503.14377 “Advancing Medical Representation Learning Through High-Quality Data”) |
| 最后更新 |
2025-06-03(arXiv:2506.02738 Open-PMC-18M 完整版,MICCAI 2026 录用) |
| 发布机构 |
Vector Institute(加拿大矢量研究所,多伦多) |
| 官方主页 |
https://github.com/vectorInstitute/pmc-data-extraction |
| 下载地址 |
https://huggingface.co/datasets/vector-institute/open-pmc |
| DOI |
10.48550/arXiv.2506.02738 |
| 引用次数 |
新发表(2025-06),引用积累中(Google Scholar,截至 2026-08) |
| AI 就绪度评分 |
⭐⭐⭐⭐(4/5)— HuggingFace 一键加载 + 完整评估脚本 + 预训练模型;扣分项:无官方 train/val/test 标准划分、子图-标题对应关系存在噪声 |
| 页面状态 |
published |
§0 E-E-A-T 信任声明与免责声明
审核体系
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、多模态医学影像分类体系、临床任务定义)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部]交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-08-04
权威论文溯源
本条目核心数据点可溯源至以下 8 篇经同行评审的权威论文:
| # |
论文 |
期刊/会议 |
核心贡献 |
引用 |
| 1 |
Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning |
MICCAI 2026 (arXiv:2506.02738) |
18M 子图-标题对 + DAB-DETR 子图提取 |
Baghbanzadeh et al., 2025 |
| 2 |
Advancing Medical Representation Learning Through High-Quality Data |
arXiv:2503.14377 |
Open-PMC 初版 + 对比学习基准 |
Baghbanzadeh et al., 2025 |
| 3 |
BIOMEDICA: A Biomedical Image-Caption Dataset for Pre-training |
ICLR 2025 |
~24M PMC 图文对 + DINO-v2 模态聚类 |
Rodríguez III et al., 2025 |
| 4 |
PubMedBERT: Domain-specific Language Model Pretraining for the Biomedical Domain |
ACL 2020 |
PubMed+PMC 从头预训练文本编码器 |
Gu et al., 2020 |
| 5 |
BioBERT: a pre-trained biomedical language representation model for biomedical text mining |
Bioinformatics 2020 |
生物医学领域 BERT 适配 |
Lee et al., 2020 |
| 6 |
DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR |
ICLR 2022 |
动态锚框查询机制加速检测收敛 |
Liu et al., 2022 |
| 7 |
MedICaT: A Dataset of Medical Images, Captions, and Textual References |
ACL 2021 |
医学图像-标题-引用数据集(子图提取先驱) |
Subramanian et al., 2021 |
| 8 |
Database resources of the National Center for Biotechnology Information in 2025 |
Nucleic Acids Research 2025 |
PMC 10M+ 文章统计与访问渠道 |
NCBI Resource Coordinators, 2025 |
强制免责声明
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Open-PMC-18M 源自 PMC Open Access Subset,文章许可类型混合(CC BY / CC BY-NC 等),逐条标注,使用者须自行确认每条数据的许可限制。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
Open-PMC-18M 是加拿大 Vector Institute 于 2025 年发布的大规模生物医学多模态数据集,包含 1800 万个从 PubMed Central 文献复合图中精准拆解的临床子图-标题对,覆盖放射学(18%)、显微镜学(73%)和可见光摄影(8%)三大模态。
它的独特价值在于突破了传统医学图文数据集"整张复合图配整段标题"的粗粒度局限——使用基于 DAB-DETR 架构的 Transformer 目标检测模型(在 50 万张合成复合图上训练),将多面板复合科学图表精准拆解为独立的单面板子图,每个子图配以经大语言模型提炼的上下文引用描述。这一高保真图文对齐使得在其上训练的视觉-语言模型(ViT-B/16 + PubMedBERT)在跨模态检索和零样本分类任务上实现了 27% 的相对性能提升,刷新了生物医学多模态表征学习的行业上限。
你可以用它来:训练一个零样本医学图像分类器(无需标注数据即可识别 18 种医学图像任务)、构建跨模态医学文献检索系统(用文本描述搜索医学图像或反向搜索)、或者研究如何将复合科学图表自动拆解为可独立分析的子图。
§1.1 摘要
Open-PMC-18M 由 Vector Institute 构建,数据源自 PubMed Central (PMC) Open Access Subset。构建管线包含四阶段:(1) 从 BIOMEDICA 数据集(~2400 万对 PMC 图文对)出发,经元数据标签和 ResNet 分类器过滤,保留临床影像和显微镜图像,得到 PMC-6M(~600 万对);(2) 训练 DAB-DETR 目标检测模型于 50 万张程序化生成的合成复合图上,实现 98.58% mAP 的子图提取精度;(3) 将 PMC-6M 的复合图分解为约 3200 万个子图,经临床相关性过滤和 ResNet-101 医学相关性二次过滤;(4) 最终产出 1800 万对高质量子图-标题对。核心创新在于"高保真图文对齐"——通过精准子图提取替代传统整图配对,显著提升了视觉-语言模型的表征学习质量。
§1.2 战略价值分析
技术创新维度:Open-PMC-18M 解决了生物医学文献图像处理中的核心痛点——“复合图问题”。生物医学论文中的图表通常是多面板复合图(compound figures),包含来自不同模态、不同视角的多个子图,但传统数据集将整张复合图与其整段标题配对,导致图文语义严重错位。Open-PMC-18M 首次在百万级规模上实现了高精度子图提取(合成数据 mAP 98.58%,真实数据 ImageCLEF 2016 mAP 36.88%,较前代 MedICaT DETR 提升 31%),为生物医学视觉-语言模型训练提供了前所未有的图文对齐质量。这一方法论突破意味着未来任何使用科学文献图像训练 AI 的团队都可以复用其 DAB-DETR 子图提取管线。
应用影响维度:该数据集在零样本分类和跨模态检索两个核心 AI 任务上设立了新基准。在 18 个零样本分类任务中,Open-PMC-18M 训练的模型在 6 个任务上排名第一,涵盖放射学、显微镜学和可见光摄影三大模态。在跨模态检索任务上,平均召回率(AR@200)达到 21.64,较此前最佳模型 PMC-15M (BioMedCLIP) 提升 27%。这意味着医疗 AI 从业者无需大规模标注数据即可构建基础医学图像理解能力,极大降低了医学 AI 应用的入场门槛。
生态推动维度:作为首个完全开放(数据+模型+代码+评估脚本)的大规模生物医学多模态数据集,Open-PMC-18M 填补了领域内"缺乏高质量预训练数据"的关键空白。与此前的 PMC-15M(Microsoft,模型开源但数据受限)和 BIOMEDICA(数据开源但缺乏子图级对齐)相比,Open-PMC-18M 实现了数据质量与开放性的双重突破,有望成为生物医学视觉-语言模型的"ImageNet 时刻"。
§1.3 横向对比表
| 数据集 |
样本量 |
图像粒度 |
模态覆盖 |
标注方式 |
核心差异化 |
| Open-PMC-18M |
18,000,000 |
子图级(单面板) |
放射学/显微镜/VLP |
DAB-DETR 提取 + ResNet 过滤 |
高保真子图级图文对齐 |
| BIOMEDICA |
~24,000,000 |
整图级(复合图) |
12 全局 + 170 局部模态 |
DINO-v2 聚类 + 专家标注 |
最大规模 PMC 图文语料 |
| PMC-15M (BioMedCLIP) |
15,000,000 |
整图级(复合图) |
广泛医学图像 |
自动提取 |
首个大规模 PMC 预训练集 |
| ROCO |
80,000+ |
整图级 |
放射学为主 |
人工标注 |
放射学专项基准 |
| MedICaT |
217,000+ |
混合(部分子图) |
广泛医学 |
2,069 人工标注 + 自动 |
首个含文本引用的医学图文集 |
| PMC-OA |
~3,000,000 |
整图级 |
全 PMC OA 范围 |
BioC 格式文本挖掘 |
基础 PMC 文本挖掘子集 |
§1.4 版本演进时间轴
| 时间 |
事件 |
| 2000-02 |
PubMed Central (PMC) 上线,NIH/NLM 建立生物医学全文归档 |
| 2003 |
PMC Open Access Subset 建立,允许文本挖掘和二次分析 |
| 2018 |
PMC BioC 文本挖掘子集发布,~300 万篇全文可编程获取 |
| 2020-06 |
BioBERT 发布,首次在 PMC 全文上预训练生物医学语言模型 |
| 2021-06 |
MedICaT 发布,首创医学图像-标题-文本引用数据集(ACL 2021) |
| 2022-07 |
BioMedCLIP (PMC-15M) 发布,首个大规模 PMC 视觉-语言预训练模型 |
| 2024-10 |
BIOMEDICA 发布(ICLR 2025),~2400 万 PMC 图文对 + DINO-v2 模态聚类 |
| 2025-03 |
Open-PMC 初版发布(arXiv:2503.14377),验证高质量数据对表征学习的影响 |
| 2025-06 |
Open-PMC-18M 完整版发布(arXiv:2506.02738),MICCAI 2026 录用 |
| 2025-06 |
DAB-DETR 子图提取模型 + 预训练 ViT-B/16 模型在 HuggingFace 开放 |
| 2025-08 |
PMC Article Dataset 分发方式重大变更:FTP 服务将于 8 月 24 日后停用 |
| 2026-08 |
PMC 全文文章超 1,160 万篇(NCBI 2025 报告:10,162,706 + 年增 ~10%) |
§1.5 典型 AI 应用场景
- 零样本医学图像分类:使用对比学习预训练的视觉-语言模型,无需标注数据即可在 18 种医学图像分类任务上实现零样本推理
- 跨模态医学文献检索:用自然语言描述搜索匹配的医学图像,或用图像反向检索相关文献段落
- 生物医学视觉-语言基础模型预训练:作为预训练语料训练通用的医学多模态大模型(类比 CLIP 在通用领域的角色)
- 复合科学图表自动拆解:使用 DAB-DETR 模型将文献中的多面板复合图自动拆解为独立子图,辅助文献挖掘
- 医学图像表征学习质量研究:研究数据质量(子图级 vs 整图级对齐)对视觉-语言模型表征学习的影响
§2 医学背景
§2.1 ICD-11 疾病编码映射
Open-PMC-18M 作为多模态文献来源数据集,不针对单一疾病,其图像覆盖广泛的生物医学领域。以下为三大模态对应的 ICD-11 章节映射:
| ICD-11 编码 |
章节名称 |
对应模态 |
典型应用 |
| 2A00–2B9F |
感染性疾病 |
显微镜学(病原体镜检图像) |
病原体识别、组织病理 |
| 2A90–2A9Y |
肿瘤影像 |
放射学 + 显微镜学 |
肿瘤检测、病理分级 |
| XH1V1 |
病理形态学 |
显微镜学 |
组织病理分类 |
| MD90–MD9Y |
眼科影像 |
可见光摄影(眼底照) |
眼底疾病筛查 |
| XD90–XD9Y |
皮肤科影像 |
可见光摄影 |
皮肤病分类 |
| CA00–CA4Z |
呼吸系统疾病 |
放射学(胸片/CT) |
肺部疾病检测 |
| BA00–BD4Z |
循环系统疾病 |
放射学(心脏影像) |
心血管影像分析 |
| XH0EK7 |
消化系统肿瘤 |
显微镜学(病理切片) |
消化道肿瘤病理 |
§2.1b SNOMED CT 映射
| 数据集模态 |
ICD-11 |
SNOMED CT |
SNOMED CT 术语 |
| Radiology(放射学) |
CA00–CA4Z |
363679005 |
Imaging technique (qualifier value) |
| Microscopy(显微镜学) |
XH1V1 |
118222006 |
Microscopy (procedure) |
| VLP - Dermatology(皮肤科) |
XD90–XD9Y |
19851009 |
Acquired abnormality of skin (disorder) |
| VLP - Endoscopy(内镜) |
DA60–DA6Z |
7152002 |
Endoscopic examination (procedure) |
| Pathology(病理学) |
XH1V1 |
363378007 |
Pathology report (record artifact) |
| Compound Figure(复合图) |
— |
41976001 |
Microscopic examination (procedure) |
§2.2 多模态医学图像背景
生物医学文献中的图像是医学知识传播的核心载体。一篇典型的生物医学研究论文包含 4-8 张图表,其中超过 60% 为多面板复合图(compound figures),每张复合图由 2-6 个子图(subfigures/panels)组成,展示不同实验条件、时间点或视角的结果。这些图像涵盖三大模态类别:
放射学影像(Radiology, 18%):包括 X 光片、CT 扫描、MRI、超声和 PET 等临床成像模态。这类图像直接反映人体内部解剖结构和病理变化,是临床诊断的核心依据。在 PMC 文献中,放射学图像常见于临床病例报告、影像学研究和临床试验论文。
显微镜学影像(Microscopy, 73%):包括组织病理切片(H&E 染色、免疫组化)、细胞学图像、荧光显微镜和电子显微镜图像。这是 PMC 文献中占比最大的图像类型,反映基础医学和转化研究的核心内容。病理切片是癌症诊断的金标准,其在文献中的丰富存在使 Open-PMC-18M 成为病理 AI 预训练的优质语料。
可见光摄影(VLP, 8%):包括皮肤病学照片(临床外观和皮损)、内镜图像(消化道/呼吸道/泌尿道)和手术视野照片。这类图像直接呈现人体表面的视觉特征,在皮肤癌筛查和内镜诊断 AI 研究中具有重要价值。
§2.3 临床任务定义
| 任务类型 |
定义 |
Open-PMC-18M 的支撑角色 |
| 零样本分类 |
模型在未经专门标注训练的情况下,仅通过图文对比即可对新图像进行分类 |
预训练视觉-语言编码器,实现零样本推理 |
| 跨模态检索 |
给定文本查询检索匹配图像,或给定图像检索匹配文本 |
预训练对齐空间支持检索任务 |
| 线性探测 |
冻结预训练编码器,仅训练线性分类头 |
提供高质量图像表征 |
| 子图检测与提取 |
从复合科学图表中自动识别和提取独立面板 |
DAB-DETR 模型直接可用 |
| 图像表征学习 |
学习通用的医学图像特征表示 |
对比学习预训练提供基础表征 |
§2.4 数据来源人群特征
| 维度 |
特征 |
| 数据来源 |
PubMed Central Open Access Subset(全球生物医学期刊开放获取文章) |
| 采集时间 |
2000 年至今(PMC 建立以来的全文归档,含 18-20 世纪 OCR 数字化文献) |
| 期刊覆盖 |
3,000+ 全参与期刊 + 251 NIH 期刊 + 45 选择性存储项目 |
| 语言分布 |
以英文为主(>95%),含少量其他语言文献 |
| 图像模态分布 |
显微镜学 73% / 放射学 18% / 可见光摄影 8% |
| 患者人口学 |
不适用(文献来源数据集,无个体患者元数据) |
§2.5 临床意义
Open-PMC-18M 的临床意义不在于直接用于临床诊断,而在于作为生物医学视觉-语言基础模型的预训练语料,间接赋能下游临床应用:
- 降低标注门槛:通过零样本和线性探针能力,减少新临床任务对大规模人工标注的依赖。一个在 Open-PMC-18M 上预训练的模型可以在仅用少量标注数据的情况下,在新的病理分类任务上达到可用性能。
- 加速文献挖掘:DAB-DETR 子图提取模型可以自动拆解文献中的复合图表,使研究人员能快速定位和提取特定实验结果的图像,加速系统综述和荟萃分析。
- 跨模态知识发现:通过视觉-语言对齐空间,研究者可以发现"哪些图像在视觉上相似但文本描述不同"或"哪些文本描述相似但图像来自不同模态"的潜在知识关联。
§2.6 金标准 / 参考标准
| 数据划分 |
标注方式 |
标注者 |
金标准性质 |
| 预训练集(17,950,000 对) |
DAB-DETR 子图提取 + ResNet-101 医学相关性过滤 |
自动化管线 |
弱监督(标题来自原始论文图注) |
| 验证集(50,000 对) |
随机采样 |
自动化管线 |
参考标准(Recall@200 监控) |
| 下游零样本评估(18 任务) |
各任务原始标注 |
各数据集原始标注团队 |
外部金标准(各数据集自有标注) |
| 子图提取评估 |
ImageCLEF 2016 人工标注 |
ImageCLEF 标注团队 |
外部金标准(人工标注框) |
§2.7 多模态医学文献图像研究变革
| 维度 |
前 Open-PMC 时代 |
Open-PMC-18M 后 |
| 图文对齐粒度 |
整图级(复合图配整段标题) |
子图级(单面板配对应描述) |
| 子图提取方法 |
人工裁剪或小规模 DETR(2,069 标注图) |
DAB-DETR(500K 合成图训练,自动提取) |
| 预训练数据规模 |
PMC-15M(15M 整图对) |
Open-PMC-18M(18M 子图对) |
| 零样本分类 |
BioMedCLIP 在部分任务上有竞争力 |
18 任务中 6 项 SOTA |
| 跨模态检索 AR@200 |
PMC-15M: 16.8 |
Open-PMC-18M: 21.64(+27%) |
| 数据开放性 |
PMC-15M 模型开放但数据受限 |
数据+模型+代码+评估全开放 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 |
推荐版本 |
大小 |
理由 |
| 零样本分类 / 跨模态检索 |
Open-PMC-18M 预训练 checkpoint |
~1 GB |
ViT-B/16 + PubMedBERT 编码器,HuggingFace 直接下载 |
| 子图提取(从文献复合图中提取子图) |
DAB-DETR 模型 |
~44 MB |
43.8M 参数,轻量级,支持 HuggingFace AutoModel 加载 |
| 从零训练视觉-语言模型 |
Open-PMC-18M 完整数据集 |
~8 TB |
1800 万对图文对,HuggingFace 流式加载 |
| 快速复现论文基准 |
评估脚本 + 下游任务数据集 |
~50 GB |
18 个零样本分类任务 + 3 个检索基准 |
| 研究数据质量对表征学习的影响 |
Open-PMC + PMC-6M 对比 |
~10 TB |
PMC-6M(复合图级)vs Open-PMC-18M(子图级)对照实验 |
§3.1 数据模态详细说明
Open-PMC-18M 包含三大生物医学图像模态,数据分布如下:
| 模态 |
占比 |
子类型 |
来源文献类型 |
典型图像尺寸 |
| 显微镜学 |
73% |
H&E 病理切片、免疫组化、荧光显微镜、电镜 |
基础研究、病理学、细胞生物学 |
512×512 ~ 2048×2048 |
| 放射学 |
18% |
X 光、CT、MRI、超声、PET |
临床研究、病例报告、影像学 |
512×512 ~ 1024×1024 |
| 可见光摄影(VLP) |
8% |
皮肤照片、内镜图像、手术视野 |
皮肤科、消化科、外科 |
256×256 ~ 1024×1024 |
| 数据类型 |
格式 |
说明 |
大小估计 |
| 子图图像 |
PNG / JPEG |
从复合图中提取的单面板图像 |
~7 TB |
| 标题文本 |
JSON / Parquet |
平均 165.8 tokens,19.48% 超过 256 tokens |
~200 GB |
| 元数据 |
CSV / Parquet |
PMCID、模态标签、来源期刊等 |
~10 GB |
| DAB-DETR 模型 |
Safetensors (43.8M params) |
子图提取检测模型 |
~44 MB |
| 预训练 VL 模型 |
PyTorch checkpoint |
ViT-B/16 + PubMedBERT 编码器 |
~1 GB |
| 评估脚本 |
Python |
mmlearn 框架,零样本检索+分类 |
~5 MB |
§3.3 数据访问渠道
| 渠道 |
地址 |
适用场景 |
限制 |
| HuggingFace Hub |
huggingface.co/datasets/vector-institute/open-pmc |
数据集流式加载、模型下载 |
需 HuggingFace 账号 |
| HuggingFace Models |
huggingface.co/vector-institute/pmc-18m-dab-detr |
DAB-DETR 子图提取模型 |
无限制 |
| GitHub |
github.com/vectorInstitute/pmc-data-extraction |
代码、训练脚本、评估管线 |
Apache 2.0 |
| PMC FTP |
ftp.ncbi.nlm.nih.gov/pub/pmc/ |
原始 PMC OA 文章(XML/PDF/TXT) |
2026-08 后停用,迁移至 Cloud |
| PMC AWS Cloud |
s3://pmc-oa-opendata/ |
大规模 PMC OA 批量获取 |
需 AWS 账号,免费 |
| BioC API |
ncbi.nlm.nih.gov/research/bionlp/APIs/BioC-PMC/ |
PMC 全文文本挖掘(~300 万篇) |
API 速率限制 |
| OAI-PMH |
www.ncbi.nlm.nih.gov/pmc/tools/oai/ |
PMC 元数据批量采集 |
OAI-PMH v2.0 协议 |
§3.4 标注方式与流程
Open-PMC-18M 的标注采用全自动化管线,包含四阶段:
阶段 1:初始收集与过滤(BIOMEDICA → PMC-6M)
- 数据源:BIOMEDICA 数据集(~2400 万图文对,源自 PMC OA Subset)
- 过滤步骤:使用 BIOMEDICA 提供的 DINO-v2 聚类标签 + ResNet 分类器
- 保留类别:临床影像、显微镜、免疫测定、化学结构
- 产出:PMC-6M(~600 万对)
阶段 2:DAB-DETR 子图提取模型训练
- 合成数据生成:程序化构造 500,000 张复合图
- 来源子图数据集:ROCO(放射学)、SICAP(病理)、HAM10000(皮肤)、RetinaMNIST(眼底)、PathMNIST(病理)、PAD-UFES-20(皮肤)、PlotQA(图表)
- 每个模态数据集贡献约 16.7%,剩余 16.7% 为混合模态
- 训练配置:4040 epochs,batch size 64,学习率 1e-5
- 性能:合成验证集 mAP 98.58% / F1 99.96%;ImageCLEF 2016 mAP 36.88% / F1 73.55%
阶段 3:复合图分解
- 将 PMC-6M 的复合图输入 DAB-DETR 模型
- 产出:约 32,000,000 个单面板子图
- 每个子图配以原始复合图的完整标题
阶段 4:质量过滤
- 第一轮:保留原始复合图被标记为 Clinical Image 或 Microscopy 的子图 → 26,000,000 对
- 第二轮:ResNet-101 医学相关性分类器 → 18,000,000 对高质量子图-标题对
- 最终产出:Open-PMC-18M
§3.5 深度溯源链
PubMed Central (PMC) Open Access Subset
├── ~10M+ 全文文章 (NIH/NLM 归档)
│ ├── CC BY / CC BY-SA (商业可用)
│ ├── CC BY-NC / CC BY-NC-SA (非商业)
│ └── 其他许可证
│
├── BIOMEDICA 数据集 (Rodríguez III et al., ICLR 2025)
│ ├── ~24M 图文对 (从 PMC OA 提取)
│ ├── DINO-v2 图像特征提取
│ ├── PCA + K-means 聚类 → 12 全局模态标签
│ └── 专家标注 → 170 局部模态标签
│
├── PMC-6M (过滤后)
│ ├── ~6M 对 (临床影像 + 显微镜)
│ └── ResNet 分类器过滤非医学图像
│
├── DAB-DETR 子图提取 (Liu et al., ICLR 2022)
│ ├── 500K 合成复合图 (程序化生成)
│ ├── 来源:ROCO / SICAP / HAM10000 / RetinaMNIST
│ │ PathMNIST / PAD-UFES-20 / PlotQA
│ ├── mAP 98.58% (合成验证)
│ └── mAP 36.88% (ImageCLEF 2016 真实数据)
│
├── Open-PMC-18M (最终数据集)
│ ├── 18M 子图-标题对
│ ├── 放射学 18% / 显微镜学 73% / VLP 8%
│ └── 平均标题长度 165.8 tokens
│
└── 预训练模型
├── ViT-B/16 (ImageNet 预训练 → Open-PMC-18M 对比学习)
├── PubMedBERT (PubMed + PMC 从头预训练)
└── InfoNCE 对比损失 (64 epochs, batch 2048, 8×A100)
| 工具 |
类型 |
功能 |
与 Open-PMC 的关系 |
| mmlearn |
训练框架 |
多模态对比学习训练与评估 |
Open-PMC 官方训练框架 |
| open_clip |
训练库 |
CLIP 风格视觉-语言训练 |
底层训练引擎 |
| DAB-DETR |
目标检测 |
复合图子图自动提取 |
Open-PMC 核心提取模型 |
| DINO-v2 |
特征提取 |
图像模态聚类与分类 |
BIOMEDICA 模态标注基础 |
| PubMedBERT |
文本编码器 |
生物医学文本理解 |
Open-PMC 文本编码器 |
| ViT-B/16 |
视觉编码器 |
图像特征提取 |
Open-PMC 视觉编码器 |
| BioMedCLIP |
基准模型 |
PMC-15M 预训练 VL 模型 |
主要对比基线 |
| BIOMEDICA |
数据集 |
~24M PMC 图文对 |
Open-PMC 的上游数据源 |
| BioC API |
文本挖掘 |
PMC 全文 BioC 格式获取 |
原始文本数据来源 |
| HuggingFace Hub |
模型托管 |
数据集与模型分发 |
Open-PMC 官方分发渠道 |
| ImageCLEF |
基准评测 |
医学图像子图提取评测 |
DAB-DETR 外部验证基准 |
| PubTator Central |
文本标注 |
35M PubMed 摘要 + 5M PMC 全文实体标注 |
下游 NLP 任务增强 |
§4 数据结构详解
§4.0 目录结构预览
open-pmc-18m/
├── data/
│ ├── train/
│ │ ├── shard_000000.parquet # 子图-标题对(分片存储)
│ │ ├── shard_000001.parquet
│ │ ├── ...
│ │ └── shard_000XXX.parquet # 共 ~1,000 个分片
│ └── val/
│ └── val_50k.parquet # 50,000 样本验证集
│
├── models/
│ ├── pmc-18m-dab-detr/ # DAB-DETR 子图提取模型
│ │ ├── config.json
│ │ ├── model.safetensors # 43.8M 参数
│ │ └── preprocessor_config.json
│ └── open-pmc-vl-checkpoint/ # 预训练视觉-语言模型
│ ├── vision_encoder.pt # ViT-B/16
│ └── text_encoder.pt # PubMedBERT
│
├── evaluation/
│ ├── zero_shot_retrieval/ # 零样本检索脚本
│ │ ├── quilt.sh # Quilt-1M (显微镜)
│ │ ├── mimic_cxr.sh # MIMIC-CXR (放射学)
│ │ └── deepauenet.sh # DeepEyeNet (VLP)
│ └── zero_shot_classification/ # 零样本分类脚本
│ ├── pcam.sh # PCam (病理)
│ ├── pad_ufes.sh # PAD-UFES-20 (皮肤)
│ └── ... # 共 18 个任务
│
├── configs/ # mmlearn 训练配置
│ └── pmcoa2_matched.yaml
│
├── scripts/ # 训练与评估 Shell 脚本
│
└── README.md
§4.1 DAIMS 标准化字段描述表
| 字段名 |
数据类型 |
说明 |
示例值 |
AI 用途 |
观测误差 |
信息性缺失编码 |
取值范围 |
image |
ImageObject |
从复合图中提取的单面板子图(PNG/JPEG) |
— |
视觉编码器输入 |
子图边界框检测误差 |
N/A |
任意尺寸 |
caption |
Text |
子图对应的标题文本 |
“Figure 2a. H&E staining of…” |
文本编码器输入 |
标题可能来自整图标题而非子图专属 |
空字符串 |
1-7352 tokens |
modality |
Enum |
图像模态标签 |
“radiology” / “microscopy” / “VLP” |
模态条件训练 / 分层评估 |
ResNet 分类器准确率 <100% |
“unknown” |
3 个类别 |
pmcid |
String |
来源文章的 PMC 登录号 |
“PMC1043859” |
溯源 / 去重 / 引用链接 |
N/A |
N/A |
PMC####### 格式 |
pmid |
String |
来源文章的 PubMed ID(如有) |
“15736975” |
跨数据库链接 |
部分文章无 PMID |
空值 |
数字字符串 |
license |
String |
文章的 CC 许可证类型 |
“CC BY” / “CC BY-NC” |
合规性过滤 |
N/A |
“unknown” |
CC 许可证类型 |
source_figure |
String |
原始复合图在文章中的标识 |
“Figure 2” |
溯源 / 复合图重建 |
N/A |
N/A |
任意字符串 |
subfigure_label |
String |
子图在复合图中的标签 |
“2a” / “2b” |
子图排序 / 面板定位 |
检测模型置信度 |
空值 |
字母+数字 |
in_text_reference |
Text |
正文中引用该子图的上下文段落 |
“As shown in Figure 2a, the tumor…” |
上下文增强 |
LLM 提炼质量 |
空字符串 |
0-500 tokens |
compound_caption |
Text |
原始复合图的完整标题 |
“Figure 2. H&E staining and IHC…” |
参考标注 |
N/A |
N/A |
任意长度 |
§4.2 标签分布统计
| 模态 |
样本数 |
占比 |
来源期刊类型 |
| 显微镜学(Microscopy) |
~13,140,000 |
73% |
病理学、细胞生物学、基础医学 |
| 放射学(Radiology) |
~3,240,000 |
18% |
临床医学、影像学、肿瘤学 |
| 可见光摄影(VLP) |
~1,440,000 |
8% |
皮肤科、消化科、外科 |
| 去除非医学(已过滤) |
~14,000,000 |
— |
图表、表格、化学结构等(已移除) |
| 总计(保留) |
~18,000,000 |
100% |
— |
§4.3 标题长度分布
| 统计量 |
值 |
| 平均标题长度 |
165.8 tokens |
| 最大标题长度 |
7,352 tokens |
| 超过 256 tokens 的标题占比 |
19.48% |
| 验证集大小 |
50,000 样本 |
§4.4 数据覆盖统计
| 维度 |
统计 |
| 总子图-标题对 |
18,000,000 |
| 来源复合图(PMC-6M) |
~6,000,000 |
| 分解后总子图(过滤前) |
~32,000,000 |
| 第一轮过滤后(临床+显微镜) |
~26,000,000 |
| 第二轮过滤后(ResNet-101) |
~18,000,000 |
| 来源期刊数 |
3,000+(PMC 全参与期刊) |
| 来源文章数(估计) |
~2,000,000+ |
| 图像格式 |
PNG / JPEG |
| 文本编码器词表 |
PubMedBERT WordPiece (30K) |
| 视觉编码器 |
ViT-B/16 (patch size 16, 224×224 输入) |
§4.5 不覆盖的数据类型
| 类型 |
说明 |
影响 |
| 非英文文献图像 |
PMC 以英文期刊为主,非英文文献图像未覆盖 |
多语言医学 AI 需要补充 |
| 非开放获取文章图像 |
仅含 CC 许可证文章,版权保护文章图像未覆盖 |
部分高影响力期刊图像缺失 |
| 视频与动态图像 |
仅含静态图像,不含医学视频 |
时间序列医学影像任务需其他数据 |
| 患者元数据 |
无年龄、性别、种族等人口学信息 |
公平性分析受限 |
| 临床报告文本 |
仅有图注,无完整临床报告 |
与 MIMIC-CXR 等报告数据集互补 |
| 非医学图像 |
图表、表格、化学结构已过滤 |
仅适用于医学图像任务 |
§5 数据划分与使用建议
§5.1 官方划分
Open-PMC-18M 未提供标准的 train/val/test 划分,而是以预训练语料形式发布:
| 划分 |
样本数 |
用途 |
| 预训练集 |
~17,950,000 |
视觉-语言对比学习预训练 |
| 验证集 |
50,000 |
检索 Recall@200 监控,选择最佳 checkpoint |
| 下游评估(外部) |
18 个零样本分类任务 + 3 个检索任务 |
外部基准评测 |
§5.2 推荐划分策略
| 策略 |
适用场景 |
划分方法 |
注意事项 |
| 按模态分层 |
模态特定分析 |
按 radiology/microscopy/VLP 分层 80/10/10 |
保持模态比例 |
| 按期刊划分 |
跨期刊泛化测试 |
按来源期刊分组,留出 10-20% 期刊 |
避免同期刊泄漏 |
| 按时间划分 |
时间泛化测试 |
按文章发表年份,2023+ 为测试集 |
评估时间漂移 |
| 按 PMCID 划分 |
文章级去重 |
同一 PMCID 的所有子图在同一划分 |
防止信息泄漏 |
| 按许可证划分 |
商业合规分析 |
CC BY vs CC BY-NC 分别评估 |
许可证影响分析 |
§5.3 下游评估任务概览
| 任务类型 |
数据集 |
模态 |
样本数 |
评估指标 |
| 跨模态检索 |
Quilt-1M (val) |
显微镜学 |
— |
Recall@200 |
| 跨模态检索 |
MIMIC-CXR (test) |
放射学 |
— |
Recall@200 |
| 跨模态检索 |
DeepEyeNet (test) |
VLP |
— |
Recall@200 |
| 零样本分类 |
MedMNIST 变体 (5 放射学) |
放射学 |
变化 |
F1-score |
| 零样本分类 |
MedMNIST 变体 (8 显微镜) |
显微镜学 |
变化 |
F1-score |
| 零样本分类 |
MedMNIST 变体 (6 VLP) |
VLP |
变化 |
F1-score |
| 线性探测 |
上述 18 任务 |
全部 |
变化 |
F1-score |
§5.4 AI 训练数据获取流程
- 确定任务类型(预训练 / 零样本推理 / 子图提取)
- 从 HuggingFace 下载预训练 checkpoint 或 DAB-DETR 模型
- 如需从零训练,流式加载 Open-PMC-18M 数据集
- 设置 mmlearn 训练配置(参考
configs/pmcoa2_matched.yaml)
- 下载下游评估数据集(Quilt-1M / MIMIC-CXR / DeepEyeNet / MedMNIST)
- 运行零样本评估脚本验证模型质量
- 按需微调或线性探测
§6 AI 就绪指南
§6.1 快速上手 — HuggingFace 加载与零样本推理
# ========================================
# Open-PMC-18M 快速上手 — 零样本分类
# 环境要求: torch>=2.0, transformers, open_clip, mmlearn
#
# 目录结构约定:
# ./open-pmc/
# ├── models/ # 预训练 checkpoint
# ├── data/ # 下游评估数据集
# └── evaluation/ # 评估脚本
#
# 安装依赖:
# pip install open_clip_torch transformers
# pip install mmlearn # 可选,用于完整训练
# ========================================
import torch
from PIL import Image
from transformers import AutoTokenizer, AutoModel
import open_clip
# 方式 1: 使用 HuggingFace 直接加载 DAB-DETR 子图提取模型
from transformers import AutoModelForObjectDetection, AutoImageProcessor
print("=== 加载 DAB-DETR 子图提取模型 ===")
model_name = "vector-institute/pmc-18m-dab-detr"
processor = AutoImageProcessor.from_pretrained(model_name)
dab_detr = AutoModelForObjectDetection.from_pretrained(model_name)
# 从复合图中提取子图
compound_figure = Image.open("compound_figure.png").convert("RGB")
inputs = processor(images=compound_figure, return_tensors="pt")
with torch.no_grad():
outputs = dab_detr(**inputs)
# 后处理检测结果
results = processor.post_process_object_detection(
outputs,
target_sizes=torch.tensor([compound_figure.size[::-1]]),
threshold=0.5
)
print(f"检测到 {len(results[0][''''''''''''''''scores''''''''''''''''])} 个子图")
for i, (score, label, box) in enumerate(zip(
results[0]["scores"], results[0]["labels"], results[0]["boxes"]
)):
print(f" 子图 {i+1}: 置信度={score:.2f}, 边界框={box.tolist()}")
# 裁剪子图
x1, y1, x2, y2 = box.tolist()
subfigure = compound_figure.crop((x1, y1, x2, y2))
subfigure.save(f"subfigure_{i+1}.png")
§6.2 跨模态检索 — 加载预训练视觉-语言编码器
# ========================================
# Open-PMC-18M 跨模态检索
# 使用预训练的 ViT-B/16 + PubMedBERT 编码器
# ========================================
import torch
import open_clip
from PIL import Image
# 加载预训练模型
# checkpoint 从 HuggingFace 下载:
# huggingface.co/datasets/vector-institute/open-pmc
model, _, train_transform = open_clip.create_model_and_transforms(
"ViT-B-16",
pretrained="path/to/open_pmc_checkpoint.pt"
)
tokenizer = open_clip.get_tokenizer("ViT-B-16")
model.eval()
device = "cuda" if torch.cuda.is_available() else "cpu"
model = model.to(device)
# 图像编码
image = Image.open("medical_image.png").convert("RGB")
image_input = train_transform(image).unsqueeze(0).to(device)
with torch.no_grad():
image_features = model.encode_image(image_input)
image_features /= image_features.norm(dim=-1, keepdim=True)
# 文本编码(零样本分类)
class_names = [
"adenocarcinoma histopathology",
"benign tissue histopathology",
"chest X-ray with pneumonia",
"chest X-ray normal",
"dermatoscopic image of melanoma",
"dermatoscopic image of nevus"
]
text_inputs = tokenizer(class_names).to(device)
with torch.no_grad():
text_features = model.encode_text(text_inputs)
text_features /= text_features.norm(dim=-1, keepdim=True)
# 计算相似度并预测
similarity = (100.0 * image_features @ text_features.T).softmax(dim=-1)
predicted_class = similarity.argmax().item()
print(f"预测类别: {class_names[predicted_class]}")
print(f"置信度: {similarity[0][predicted_class]:.4f}")
# 跨模态检索(给定文本,检索图像)
query_text = "microscopy image of breast cancer tissue"
query_input = tokenizer([query_text]).to(device)
with torch.no_grad():
query_features = model.encode_text(query_input)
query_features /= query_features.norm(dim=-1, keepdim=True)
# 与图像库中的特征计算相似度
# image_library_features: [N, 512] 预计算的图像特征矩阵
# similarities = (100.0 * query_features @ image_library_features.T)
# top_k_indices = similarities.argsort(descending=True)[:10]
§6.3 HuggingFace 数据集流式加载
# ========================================
# Open-PMC-18M 数据集流式加载
# 适用于大规模预训练数据读取
# ========================================
from datasets import load_dataset
from torch.utils.data import DataLoader
import torch
# 流式加载(避免一次性下载 8TB 数据)
dataset = load_dataset(
"vector-institute/open-pmc",
split="train",
streaming=True # 流式模式
)
# 自定义 collate 函数
def collate_fn(batch):
images = [item["image"] for item in batch]
captionevent-blocked= [item["caption"] for item in batch]
modalities = [item.get("modality", "unknown") for item in batch]
return {"images": images, "captions": captions, "modalities": modalities}
dataloader = DataLoader(
dataset,
batch_size=256,
collate_fn=collate_fn,
num_workers=4
)
# 遍历数据集
for batch in dataloader:
images = batch["images"] # List[PIL.Image]
captionevent-blocked= batch["captions"] # List[str]
modalities = batch["modalities"] # List[str]
print(f"Batch: {len(images)} samples")
print(f" 首个标题: {captions[0][:100]}...")
print(f" 模态: {modalities[0]}")
break # 示例仅展示一个 batch
# 按模态过滤
from datasets import IterableDataset
def filter_microscopy(example):
return example.get("modality") == "microscopy"
microscopy_dataset = dataset.filter(filter_microscopy)
§6.4 DAB-DETR 合成数据生成管线
# ========================================
# DAB-DETR 合成复合图生成(复现论文管线)
# 用于训练子图提取模型的合成数据
# ========================================
import numpy as np
from PIL import Image, ImageDraw, ImageFont
import random
import os
def generate_compound_figure(
subfigures,
grid_size=(2, 2),
margin=(20, 20),
label_scheme="alphabetical",
aspect_ratio=None
):
"""
生成合成复合图用于 DAB-DETR 训练
参数:
subfigures: List[PIL.Image] - 单面板子图列表
grid_size: (rows, cols) - 网格布局
margin: (h_margin, v_margin) - 子图间距
label_scheme: "alphabetical" / "numerical" / "compound"
aspect_ratio: 固定宽高比或 None
返回:
compound_image: PIL.Image - 合成复合图
bboxes: List[(x1, y1, x2, y2, label)] - 子图边界框与标签
"""
rows, cols = grid_size
n_panels = min(len(subfigures), rows * cols)
# 确定子图尺寸
max_w = max(img.width for img in subfigures[:n_panels])
max_h = max(img.height for img in subfigures[:n_panels])
if aspect_ratio:
max_w = int(max_h * aspect_ratio)
# 计算复合图尺寸
total_w = cols * max_w + (cols + 1) * margin[0]
total_h = rows * max_h + (rows + 1) * margin[1]
compound = Image.new("RGB", (total_w, total_h), (255, 255, 255))
draw = ImageDraw.Draw(compound)
bboxes = []
labels = "abcdefghijklmnopqrstuvwxyz"
for i in range(n_panels):
row, col = i // cols, i % cols
x = margin[0] + col * (max_w + margin[0])
y = margin[1] + row * (max_h + margin[1])
# 缩放子图到统一尺寸
subfig = subfigures[i].resize((max_w, max_h))
compound.paste(subfig, (x, y))
# 添加标签
if label_scheme == "alphabetical":
label = labels[i]
elif label_scheme == "numerical":
label = str(i + 1)
else:
label = f"{i+1}{labels[i]}"
draw.text((x + 5, y + 5), label, fill="black")
bboxes.append((x, y, x + max_w, y + max_h, label))
return compound, bboxes
# 从多个数据集采样子图生成合成复合图
# 数据集: ROCO, SICAP, HAM10000, RetinaMNIST, PathMNIST, PAD-UFES-20, PlotQA
source_datasets = {
"ROCO": "/data/roco/",
"SICAP": "/data/sicap/",
"HAM10000": "/data/ham10000/",
"RetinaMNIST": "/data/retinamnist/",
"PathMNIST": "/data/pathmnist/",
"PAD-UFES-20": "/data/pad_ufes/",
"PlotQA": "/data/plotqa/"
}
# 生成 500,000 张合成复合图
for i in range(500000):
# 随机选择 2-6 个子图
n_subfigs = random.randint(2, 6)
selected = []
for _ in range(n_subfigs):
dataset_name = random.choice(list(source_datasets.keys()))
dataset_path = source_datasets[dataset_name]
images = os.listdir(dataset_path)
img_path = os.path.join(dataset_path, random.choice(images))
selected.append(Image.open(img_path).convert("RGB"))
# 生成复合图
compound, bboxes = generate_compound_figure(selected)
compound.save(f"/data/synthetic/compound_{i:06d}.png")
# 保存标注(COCO 格式)
# annotation = {"image": f"compound_{i:06d}.png", "bboxes": bboxes}
§6.5 零样本分类评估
# ========================================
# Open-PMC-18M 零样本分类评估
# 复现论文中 18 个任务的零样本评估
# ========================================
import torch
import open_clip
import numpy as np
from sklearn.metrics import f1_score
from PIL import Image
import json
# 加载模型
model, _, val_transform = open_clip.create_model_and_transforms(
"ViT-B-16",
pretrained="path/to/open_pmc_checkpoint.pt"
)
tokenizer = open_clip.get_tokenizer("ViT-B-16")
model.eval().cuda()
# 定义分类任务的 prompt 模板
prompt_templates = [
"a microscopy image of {}",
"a histopathology image showing {}",
"a radiology image of {}",
"a clinical photograph of {}",
]
def zero_shot_classify(image_path, class_names, modality="microscopy"):
"""对单张图像进行零样本分类"""
image = Image.open(image_path).convert("RGB")
image_input = val_transform(image).unsqueeze(0).cuda()
# 为每个类别生成多个 prompt 并取平均
all_text_features = []
for class_name in class_names:
prompts = [t.format(class_name) for t in prompt_templates]
text_inputs = tokenizer(prompts).cuda()
with torch.no_grad():
text_features = model.encode_text(text_inputs)
text_features /= text_features.norm(dim=-1, keepdim=True)
all_text_features.append(text_features.mean(dim=0))
all_text_features = torch.stack(all_text_features)
with torch.no_grad():
image_features = model.encode_image(image_input)
image_features /= image_features.norm(dim=-1, keepdim=True)
similarity = (100.0 * image_features @ all_text_features.T).softmax(dim=-1)
return similarity.cpu().numpy()[0]
# 评估 MedMNIST 系列数据集
medmnist_tasks = {
"PathMNIST": {
"classes": ["adipose", "background", "debris", "lymphocytes",
"mucus", "smooth muscle", "normal colon mucosa",
"cancer-associated stroma", "colorectal adenocarcinoma epithelium"],
"modality": "microscopy"
},
"DermaMNIST": {
"classes": ["actinic keratoses", "basal cell carcinoma", "benign keratosis-like lesions",
"dermatofibroma", "melanoma", "melanocytic nevi", "vascular lesions"],
"modality": "VLP"
},
"OctMNIST": {
"classes": ["CNV", "DME", "DRUSEN", "NORMAL"],
"modality": "radiology"
},
# ... 共 18 个任务
}
results = {}
for task_name, task_config in medmnist_tasks.items():
print(f"\n评估 {task_name}...")
class_names = task_config["classes"]
modality = task_config["modality"]
# 加载测试集(需自行下载 MedMNIST)
# test_images, test_labels = load_medmnist(task_name, split="test")
predictionevent-blocked= []
true_labels = []
# for image, label in zip(test_images, test_labels):
# probs = zero_shot_classify(image, class_names, modality)
# predictions.append(probs.argmax())
# true_labels.append(label)
# f1 = f1_score(true_labels, predictions, average="weighted")
# results[task_name] = {"f1": f1, "n_samples": len(true_labels)}
# print(f" F1-score: {f1:.4f}")
# 按模态汇总
print("\n=== 按模态汇总 ===")
for modality in ["radiology", "microscopy", "VLP"]:
modality_tasks = {k: v for k, v in results.items()
if medmnist_tasks[k]["modality"] == modality}
if modality_tasks:
avg_f1 = np.mean([v["f1"] for v in modality_tasks.values()])
print(f"{modality}: 平均 F1 = {avg_f1:.4f} ({len(modality_tasks)} 个任务)")
§6.6 PMC OA Subset 批量下载(AWS S3)
# ========================================
# PMC Open Access Subset AWS S3 批量下载
# 适用于需要原始 PMC 文章(XML/PDF/媒体文件)的场景
# ========================================
import boto3
import pandas as pd
import os
# S3 客户端(匿名访问,免费)
s3 = boto3.client(
"s3",
regionevent-blocked="us-east-1",
conevent-blocked=boto3.session.Config(signature_version="s3v4")
)
bucket_name = "pmc-oa-opendata"
# 下载商业可用文章清单(CC BY / CC0)
print("下载 CC BY 文章清单...")
s3.download_file(
bucket_name,
"oa_comm/metadata/csv/oa_comm.filelist.csv",
"oa_comm_filelist.csv"
)
filelist = pd.read_csv("oa_comm_filelist.csv")
print(f"商业可用文章数: {len(filelist)}")
print(f"列名: {filelist.columns.tolist()}")
print(filelist.head())
# 批量下载 XML 全文
def download_pmc_articles(pmcids, output_dir="pmc_articles"):
"""批量下载 PMC 文章 XML"""
os.makedirs(output_dir, exist_ok=True)
for pmcid in pmcids:
# 构造 S3 路径
key = f"oa_comm/xml/all/PMC{pmcid}.xml"
local_path = os.path.join(output_dir, f"PMC{pmcid}.xml")
try:
s3.download_file(bucket_name, key, local_path)
print(f" 下载: PMC{pmcid}")
except Exception as e:
print(f" 失败: PMC{pmcid} - {e}")
# 下载前 100 篇 CC BY 文章
sample_pmcids = filelist["AccessionID"].head(100).str.replace("PMC", "").tolist()
download_pmc_articles(sample_pmcids)
# 使用 AWS CLI 批量同步(命令行)
# aws s3 sync s3://pmc-oa-opendata/oa_comm/xml/all/ ./pmc_xml/ no-sign-request
§6.7 BioC API 文本挖掘
# ========================================
# PMC BioC API — 全文文本挖掘
# 获取 PMC 文章的全文(BioC XML/JSON 格式)
# ========================================
import requests
import xml.etree.ElementTree as ET
BIOC_API = "https://www.ncbi.nlm.nih.gov/research/bionlp/APIs/BioC-PMC/"
def get_pmc_fulltext(pmcid, format="json"):
"""
获取 PMC 文章全文(BioC 格式)
参数:
pmcid: PMC ID (如 "1043859")
format: "json" 或 "xml"
返回:
全文文本和注释
"""
url = f"{BIOC_API}PMC{pmcid}/{format}"
responevent-blocked= requests.get(url)
if response.status_code != 200:
print(f"获取 PMC{pmcid} 失败: {response.status_code}")
return None
return response.json() if format == "json" else response.text
def extract_figure_citations(pmcid):
"""
提取文章中引用图表的上下文句子
用于丰富子图的上下文描述
"""
article = get_pmc_fulltext(pmcid, "json")
if not article:
return []
citationevent-blocked= []
# 遍历文档中的每个段落
for document in article.get("documents", []):
for passage in document.get("passages", []):
text = passage.get("text", "")
# 查找引用图表的句子
import re
matches = re.finditer(
r''''''''''''''''(?:Figure|Fig\.?|Figure)\s*\d+[a-z]?'''''''''''''''',
text,
re.IGNORECASE
)
for match in matches:
# 获取引用所在句子
sent_start = text.rfind(".", 0, match.start()) + 1
sent_end = text.find(".", match.end())
if sent_end == -1:
sent_end = len(text)
sentence = text[sent_start:sent_end].strip()
citations.append({
"figure_ref": match.group(),
"context": sentence,
"pmcid": pmcid
})
return citations
# 示例:提取 PMC1043859 中的图表引用
citationevent-blocked= extract_figure_citations("1043859")
for c in citations[:5]:
print(f"引用: {c[''''''''''''''''figure_ref'''''''''''''''']}")
print(f" 上下文: {c[''''''''''''''''context''''''''''''''''][:150]}...")
§6.8 计算资源需求
| 任务 |
GPU 需求 |
内存 |
磁盘 |
预计时间 |
| DAB-DETR 推理(单张复合图) |
1× 任意 GPU |
4 GB |
1 GB |
<1 秒 |
| DAB-DETR 训练(500K 合成图) |
4× A100 80GB |
64 GB |
500 GB |
~48 小时 |
| 零样本分类评估(18 任务) |
1× A100 40GB |
16 GB |
50 GB |
~2 小时 |
| 跨模态检索评估(3 基准) |
1× A100 40GB |
16 GB |
100 GB |
~1 小时 |
| 对比学习预训练(18M 对,64 epochs) |
8× A100 80GB |
256 GB |
10 TB |
~5-7 天 |
| HuggingFace 流式加载 + 微调 |
1× A100 40GB |
32 GB |
1 TB |
视任务而定 |
| 线性探测评估(18 任务) |
1× V100 16GB |
8 GB |
50 GB |
~30 分钟 |
| PMC OA S3 批量下载(10K 文章) |
无 |
4 GB |
50 GB |
~2 小时 |
§6.9 常见坑点
| # |
坑点 |
影响 |
解决方案 |
| 1 |
子图-标题对应不精确 |
复合图拆解后,子图配以整图标题而非子图专属标题,存在语义噪声 |
使用 LLM 从正文中提取 in-text reference 作为补充上下文 |
| 2 |
DAB-DETR 真实数据精度有限 |
ImageCLEF 2016 上 mAP 仅 36.88%,复杂布局的复合图可能提取失败 |
设置较高阈值(>0.5),人工审核低置信度结果 |
| 3 |
标题长度超过 256 tokens |
19.48% 的标题超过 256 tokens,可能被文本编码器截断 |
使用长上下文模型或分段编码 |
| 4 |
模态分布不均衡 |
显微镜学占 73%,放射学和 VLP 样本相对不足 |
分层采样或加权损失函数 |
| 5 |
许可证混合 |
数据来自不同 CC 许可证文章,商业使用须谨慎筛选 |
使用元数据中的 license 字段过滤 CC BY/CC0 |
| 6 |
无标准 train/test 划分 |
需自行划分,不同划分导致结果不可比 |
按 PMCID 划分,确保同文章子图在同一划分 |
| 7 |
HuggingFace 流式加载限制 |
8TB 数据无法全量下载,需流式处理 |
使用 streaming=True + 自定义缓存策略 |
| 8 |
评估数据集需单独下载 |
18 个下游任务数据集(MedMNIST 等)需独立获取 |
参考 evaluation/ 目录中的脚本和说明 |
| 9 |
PMC FTP 即将停用 |
2026 年 8 月后 FTP 服务停用,迁移至 AWS Cloud |
尽早迁移到 S3 访问方式 |
| 10 |
合成训练数据与真实分布差异 |
DAB-DETR 在合成数据上 mAP 98.58%,真实数据仅 36.88% |
在真实标注数据上验证后再部署 |
| 11 |
图像分辨率不一致 |
子图来源多样,分辨率从 256×256 到 2048×2048 不等 |
统一 resize 到 224×224(ViT 输入尺寸)或保持原始分辨率 |
| 12 |
缺少患者元数据 |
无年龄、性别、种族信息,无法做公平性分析 |
如需公平性分析,补充 MIMIC-CXR 或 PadChest 等含元数据的数据集 |
§7 质量评估与局限性
§7.1 已知偏倚
| # |
偏倚类型 |
描述 |
影响程度 |
缓解策略 |
| 1 |
模态偏倚 |
显微镜学占 73%,放射学和 VLP 欠represented |
高 |
分层采样 / 模态加权 |
| 2 |
期刊偏倚 |
来源限于 PMC OA 期刊,偏向英语出版物 |
中 |
补充非英文文献数据集 |
| 3 |
许可证偏倚 |
仅含 CC 许可证文章,高影响力期刊可能未开放 |
中 |
补充版权受限数据集的标注子集 |
| 4 |
标题噪声 |
子图配以整图标题而非子图专属标题 |
高 |
使用 in-text reference 增强语义 |
| 5 |
子图检测误差 |
DAB-DETR 在真实数据上 mAP 36.88% |
高 |
人工审核 + 阈值调整 |
| 6 |
时间偏倚 |
数据跨越 2000-2025 年,早期图像质量较差 |
低 |
按发表年份分层分析 |
| 7 |
分辨率偏倚 |
不同来源图像分辨率差异大 |
中 |
统一预处理 |
| 8 |
领域偏倚 |
基础研究论文占比高于临床研究 |
中 |
按文章类型分层 |
| 9 |
人群偏倚 |
文献图像来源人群不可追踪 |
中 |
无法直接缓解 |
| 10 |
模态标注偏倚 |
ResNet 分类器模态标注准确率 <100% |
低 |
人工抽检校正 |
| 11 |
合成-真实差距 |
DAB-DETR 训练于合成数据,真实分布存在差异 |
高 |
增加真实标注数据微调 |
| 12 |
评估偏倚 |
下游评估数据集(MedMNIST 等)本身可能不全面 |
低 |
使用多基准交叉验证 |
§7.2 QC 指标
| 指标 |
说明 |
Open-PMC-18M 表现 |
| 子图提取精度(合成) |
DAB-DETR 在合成验证集上的 mAP |
98.58% |
| 子图提取精度(真实) |
DAB-DETR 在 ImageCLEF 2016 上的 mAP |
36.88% |
| 医学相关性过滤准确率 |
ResNet-101 分类器的医学图像识别率 |
未公开 |
| 标题-图像对齐质量 |
子图与标题语义匹配程度(人工评估) |
未公开 |
| 跨模态检索 AR@200 |
平均召回率(3 个检索基准) |
21.64(SOTA) |
| 零样本分类平均 F1 |
18 任务加权平均 F1 |
最高(6/18 任务第一) |
| 鲁棒性比率 |
视觉扰动下检索性能保持率 |
显著优于基线(p<0.01) |
| 嵌入空间分离度 |
t-SNE + MMD 度量模态间分离 |
统计显著(p<0.01) |
§7.3 外部验证矩阵
| 验证维度 |
验证方法 |
结果 |
| 子图提取质量 |
ImageCLEF 2016 基准 |
mAP 36.88%(+31% vs MedICaT DETR 28.20%) |
| 跨模态检索 |
Quilt-1M / MIMIC-CXR / DeepEyeNet |
AR@200 = 21.64(SOTA) |
| 零样本分类 |
MedMNIST 18 任务 |
6/18 排名第一 |
| 线性探测 |
MedMNIST 18 任务 |
平均最高 |
| 鲁棒性 |
亮度/旋转/翻转/缩放扰动 |
显著优于基线(Wilcoxon p<0.01) |
| 嵌入空间质量 |
t-SNE 可视化 + MMD 检验 |
模态间统计显著分离 |
§7.4 DAIMS 24 项数据就绪度评估表
| # |
DAIMS 检查项 |
状态 |
说明 |
| 1 |
数据集名称与标识 |
✅ |
Open-PMC-18M,HuggingFace ID 明确 |
| 2 |
数据集版本号 |
✅ |
v1.0(2025-06),MICCAI 2026 录用版 |
| 3 |
数据集描述 |
✅ |
完整论文 + README |
| 4 |
数据集来源 |
✅ |
PMC OA Subset → BIOMEDICA → PMC-6M → DAB-DETR → 18M |
| 5 |
数据收集方法 |
✅ |
全自动化管线(DAB-DETR + ResNet 过滤) |
| 6 |
数据收集时间范围 |
✅ |
PMC 2000-2025 年文献 |
| 7 |
数据地理覆盖 |
⚠️ |
全球 PMC OA 期刊,以英文为主 |
| 8 |
数据人口学特征 |
❌ |
无患者人口学元数据 |
| 9 |
数据标注方法 |
✅ |
自动化标注(子图提取 + 模态分类) |
| 10 |
标注者资质 |
✅ |
自动化管线,无人工标注者 |
| 11 |
标注一致性 |
⚠️ |
DAB-DETR 自动提取,真实数据精度有限 |
| 12 |
数据格式说明 |
✅ |
Parquet / PNG-JPEG / JSON |
| 13 |
数据字段定义 |
✅ |
DAIMS 字段表(§4.1) |
| 14 |
数据大小与存储 |
✅ |
~8 TB,HuggingFace 流式加载 |
| 15 |
数据访问方式 |
✅ |
HuggingFace / GitHub / AWS S3 |
| 16 |
数据许可证 |
✅ |
PMC OA 混合 CC 许可证,逐条标注 |
| 17 |
数据使用限制 |
✅ |
CC BY(商业可用)/ CC BY-NC(非商业) |
| 18 |
数据质量评估 |
✅ |
ImageCLEF + 下游任务基准 |
| 19 |
已知偏倚 |
✅ |
12 项偏倚详细记录(§7.1) |
| 20 |
数据更新频率 |
⚠️ |
首次发布,尚无定期更新计划 |
| 21 |
数据引用方式 |
✅ |
BibTeX 提供 |
| 22 |
伦理审查 |
✅ |
已发表文献去识别化图像,无 IRB 需求 |
| 23 |
数据删除机制 |
⚠️ |
依赖 PMC 原文删除,数据集层面无独立机制 |
| 24 |
机器可读元数据 |
✅ |
HuggingFace Dataset Card + Croissant 兼容 |
DAIMS 总评:21/24 (87.5%),⭐⭐⭐⭐ (4/5)
§8 基准性能与生态
§8.1 跨模态检索排行榜
| 模型 |
训练数据 |
MIMIC-CXR (I→T) |
Quilt (I→T) |
DeepEyeNet (I→T) |
AR@200 |
| Open-PMC-18M |
18M 子图对 |
22.6% |
21.1% |
19.6% |
21.64 |
| PMC-6M |
6M 复合图对 |
25.0% |
20.3% |
17.2% |
21.22 |
| Open-PMC(初版) |
6M + in-text |
17.0% |
16.6% |
18.3% |
17.0 |
| BioMedCLIP (PMC-15M) |
15M 复合图对 |
18.5% |
16.5% |
16.2% |
16.8 |
| PMC-OA |
~3M 对 |
13.9% |
14.2% |
15.2% |
14.8 |
| BIOMEDICA (BMCA-CLIP) |
~24M 复合图对 |
7.6% |
16.9% |
15.5% |
13.9 |
| ROCO |
80K 对 |
8.0% |
2.4% |
7.9% |
6.6 |
注:I→T = Image-to-Text 检索 Recall@200;AR = Average Recall(3 任务均值)。Open-PMC-18M 在 3 个检索任务中 2 个排名第一,AR@200 较此前最佳 PMC-6M 提升 2%。
§8.2 零样本分类基准
| 模型 |
放射学(5 任务) |
显微镜学(8 任务) |
VLP(6 任务) |
排名第一任务数 |
| Open-PMC-18M |
最高平均 |
最高平均 |
最高平均 |
6/18 |
| PMC-6M |
第二 |
第二 |
第二 |
3/18 |
| BioMedCLIP (PMC-15M) |
第三 |
第三 |
第三 |
2/18 |
| BIOMEDICA |
第四 |
第四 |
第四 |
1/18 |
| PMC-OA |
第五 |
第五 |
第五 |
0/18 |
| ROCO |
最低 |
最低 |
最低 |
0/18 |
注:零样本分类使用 F1-score 评估,具体 18 个任务见论文 Table 4。Open-PMC-18M 在 18 个任务中 6 项排名第一、2 项排名第二。
| 模型 |
合成验证集 mAP |
合成验证集 F1 |
ImageCLEF 2016 mAP |
ImageCLEF 2016 F1 |
| DAB-DETR(Open-PMC) |
98.58% |
99.96% |
36.88% |
73.55% |
| MedICaT DETR(前代) |
33.22% |
73.18% |
28.20% |
64.85% |
提升幅度:合成数据 mAP 提升 65.36 个百分点,真实数据 mAP 提升 8.68 个百分点(+31% 相对提升)。
§8.4 关键论文 Top 10
| # |
论文 |
期刊/会议 |
年份 |
核心贡献 |
| 1 |
Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset |
MICCAI 2026 |
2025 |
18M 子图对 + DAB-DETR SOTA |
| 2 |
Advancing Medical Representation Learning Through High-Quality Data |
arXiv |
2025 |
数据质量对 VL 模型的影响 |
| 3 |
BIOMEDICA: A Biomedical Image-Caption Dataset |
ICLR 2025 |
2025 |
~24M PMC 图文对 + 模态聚类 |
| 4 |
PubMedBERT: Domain-specific Pretraining |
ACL 2020 |
2020 |
PubMed+PMC 从头预训练 |
| 5 |
BioBERT: Pre-trained Biomedical Language Model |
Bioinformatics |
2020 |
生物医学 BERT 适配 |
| 6 |
DAB-DETR: Dynamic Anchor Boxes for DETR |
ICLR 2022 |
2022 |
动态锚框加速检测收敛 |
| 7 |
MedICaT: Medical Images, Captions, Textual References |
ACL 2021 |
2021 |
医学图文+引用数据集先驱 |
| 8 |
BioMedCLIP: A Multimodal Biomedical Foundation Model |
arXiv |
2022 |
PMC-15M 预训练 VL 模型 |
| 9 |
Database resources of NCBI in 2025 |
Nucleic Acids Research |
2025 |
PMC 10M+ 统计与访问 |
| 10 |
BioGPT: Generative Pre-trained Transformer for Biomedical Text |
Briefings in Bioinformatics |
2022 |
15M PubMed 摘要预训练 GPT |
§8.5 Open-PMC 在 AI 生态中的角色
| 生态层 |
角色 |
说明 |
| 预训练语料层 |
生物医学 VL 基础模型预训练 |
类比 ImageNet 之于视觉、C4 之于语言 |
| 评估基准层 |
零样本分类+跨模态检索基准 |
18+3 个标准化评估任务 |
| 工具链层 |
DAB-DETR 子图提取工具 |
可独立用于文献图表处理 |
| 方法论层 |
合成数据训练检测模型范式 |
500K 合成图 → 真实数据迁移 |
| 数据质量研究层 |
子图级 vs 整图级对齐对比 |
数据质量对表征学习的影响 |
| 开放科学层 |
数据+模型+代码+评估全开放 |
可复现性标杆 |
| 文献挖掘层 |
复合图自动拆解 |
加速系统综述和荟萃分析 |
§8.6 真实世界影响案例
| # |
应用场景 |
描述 |
影响 |
| 1 |
零样本病理分类 |
无需标注数据即可在 PathMNIST 上实现病理图像分类 |
降低病理 AI 标注成本 |
| 2 |
皮肤癌筛查预训练 |
在 PAD-UFES-20 和 DermaMNIST 上零样本分类 |
支持资源受限地区皮肤癌筛查 |
| 3 |
眼底图像检索 |
DeepEyeNet 上跨模态检索 SOTA |
眼科影像检索系统基础 |
| 4 |
文献复合图拆解 |
DAB-DETR 模型用于系统综述中的图表提取 |
加速循证医学研究 |
| 5 |
胸片报告检索 |
MIMIC-CXR 上图文检索 |
支持放射科报告搜索 |
| 6 |
多模态知识发现 |
视觉-语言对齐空间中的跨模态关联挖掘 |
发现文献中隐含的图文关系 |
| 7 |
数据质量研究 |
子图级 vs 整图级对齐对比实验 |
为医学 VL 数据集设计提供指导 |
| 8 |
合成数据方法论 |
500K 合成图训练 → 真实数据迁移范式 |
可推广到其他检测任务 |
| 9 |
生物医学 CLIP |
作为生物医学领域的 CLIP 基础模型 |
催生下游医学多模态应用 |
§8.7 生态快照
┌──────────────────────────────────────┐
│ PMC Open Access Subset │
│ ~10M+ 全文文章 (NIH/NLM) │
│ CC BY / CC BY-NC / CC BY-SA 混合 │
└──────────────┬───────────────────────┘
│
┌──────────────▼───────────────────────┐
│ BIOMEDICA (ICLR 2025) │
│ ~24M 图文对 + DINO-v2 模态聚类 │
└──────────────┬───────────────────────┘
│ 过滤: 临床+显微镜
┌──────────────▼───────────────────────┐
│ PMC-6M (~6M 对) │
│ 复合图级图文对(未经子图分解) │
└──────────────┬───────────────────────┘
│ DAB-DETR 子图提取
┌──────────────▼───────────────────────┐
│ Open-PMC-18M (18M 子图对) │
│ 放射学 18% / 显微镜 73% / VLP 8% │
└──────┬───────────────┬───────────────┘
│ │
┌───────────────▼───┐ ┌────────▼──────────────┐
│ 预训练 VL 模型 │ │ DAB-DETR 提取工具 │
│ ViT-B/16 + │ │ 43.8M 参数 │
│ PubMedBERT │ │ HuggingFace 可用 │
│ InfoNCE 对比学习 │ │ 阈值可调 │
└───────┬───────────┘ └───────────────────────┘
│
┌──────────────▼──────────────────────────────────┐
│ 下游评估任务 │
├─────────────────┬──────────────┬────────────────┤
│ 跨模态检索 ×3 │ 零样本分类×18 │ 线性探测 ×18 │
│ Quilt-1M │ MedMNIST │ MedMNIST │
│ MIMIC-CXR │ PAD-UFES-20 │ PAD-UFES-20 │
│ DeepEyeNet │ ... │ ... │
└─────────────────┴──────────────┴────────────────┘
│
┌──────────────▼──────────────────────────────────┐
│ 生态工具与框架 │
├────────────┬───────────┬──────────┬─────────────┤
│ mmlearn │ open_clip │ BioC API │ HuggingFace │
│ 训练框架 │ CLIP 库 │ 文本挖掘 │ 分发平台 │
└────────────┴───────────┴──────────┴─────────────┘
§9 相关资源与引用
§9.1 BibTeX 参考文献
@inproceedings{baghbanzadeh2025openpmc18m,
title={Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning},
author={Baghbanzadeh, Negin and Islam, Mohammed Saidul and Ashkezari, Sajad and Dolatabadi, Elham and Afkanpour, Arash},
booktitle={Medical Image Computing and Computer-Assisted Intervention (MICCAI)},
year={2026},
note={arXiv:2506.02738}
}
@article{baghbanzadeh2025advancing,
title={Advancing Medical Representation Learning Through High-Quality Data},
author={Baghbanzadeh, Negin and Fallahpour, Adibvafa and Parhizkar, Yasaman and Ogidi, Franklin and Roy, Shuvendu and Ashkezari, Sajad and Khazaie, Vahid Reza and Colacci, Michael and Etemad, Ali and Afkanpour, Arash and Dolatabadi, Elham},
journal={arXiv preprint arXiv:2503.14377},
year={2025}
}
@inproceedings{rodriguez2025biomedica,
title={BIOMEDICA: A Biomedical Image-Caption Dataset for Pre-training},
author={Rodr{\''''''''''''''''\i}guez III, Alejandro and others},
booktitle={International Conference on Learning Representations (ICLR)},
year={2025}
}
@inproceedings{gu2020pubmedbert,
title={Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing},
author={Gu, Yu and others},
booktitle={ACM Transactions on Computing for Healthcare (Healthcare)},
year={2020}
}
@article{lee2020biobert,
title={BioBERT: a pre-trained biomedical language representation model for biomedical text mining},
author={Lee, Jinhyuk and others},
journal={Bioinformatics},
volume={36},
number={4},
pages={12341240},
year={2020}
}
@inproceedings{liu2022dabdetr,
title={DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR},
author={Liu, Shilong and others},
booktitle={International Conference on Learning Representations (ICLR)},
year={2022}
}
@inproceedings{subramanian2021medicat,
title={MedICaT: A Dataset of Medical Images, Captions, and Textual References},
author={Subramanian, Sanjay and others},
booktitle={Findings of ACL},
year={2021}
}
@article{ncbi2025database,
title={Database resources of the National Center for Biotechnology Information in 2025},
author={NCBI Resource Coordinators},
journal={Nucleic Acids Research},
volume={53},
number={D1},
pages={D1D10},
year={2025}
}
@article{luo2022biogpt,
title={BioGPT: generative pre-trained Transformer for biomedical text generation and mining},
author={Luo, Renqian and others},
journal={Briefings in Bioinformatics},
volume={23},
number={6},
year={2022}
}
@article{zhang2024biomedclip,
title={Large-scale Biomedical Vision-Language Pre-training},
author={Zhang, Sheng and others},
journal={arXiv preprint arXiv:2303.00915},
year={2023}
}
§9.2 资源 URL 表
§10 AI 使用声明卡
| 项目 |
声明 |
| 数据集用途 |
生物医学视觉-语言模型预训练、零样本医学图像分类、跨模态医学文献检索、复合科学图表自动拆解 |
| 适用人群 |
AI/ML 研究人员、生物医学信息学开发者、医学多模态大模型团队 |
| 不适用场景 |
直接用于临床诊断、个体患者治疗决策、医疗器械审批 |
| 使用前必读 |
(1) 检查每条数据的 CC 许可证类型,确认是否符合您的使用场景(商业/非商业);(2) 评估子图-标题对应精度对下游任务的影响;(3) 关注模态分布偏倚(显微镜学 73%);(4) 如需标准 train/test 划分,须自行构建并报告 |
| 引用要求 |
使用本数据集时须引用 Baghbanzadeh et al. (2025) arXiv:2506.02738 及 arXiv:2503.14377 |
| 页面状态 |
published |
| 最后审核 |
2026-08-04 |