ZJU Eye-Pretrain

ZJU Eye-Pretrain是一个大规模、统一的多源眼科影像数据集,包含超过110万张图像,涵盖OCT B扫描、彩色眼底图和灰度扫描激光检眼镜等多种模态,数据整合自私人采集和25个公开数据集,并遵循严格的统一数据模式,适用于图像分类、分割、生成等计算机视觉任务,主要用于医学基础模型预训练、眼科影像分析及迁移学习。

Hugging Face
2026-05-28 更新
浏览 20
眼科医学影像医学影像分析

基本信息

创建/更新时间
2026-05-28

资源简介

ZJU Eye-Pretrain是一个专为医学基础模型预训练及下游任务设计的大规模、统一多源眼科影像数据集。该数据集整合了来自私人采集和25个公开数据集的资源,总计包含超过110万张图像,涵盖26个不同的队列。数据集主要由三部分构成:私人采集的上海Topcon DRI OCT Triton扫频源OCT数据(约41.9万张图像,包含OCT B扫描、彩色眼底图和灰度扫描激光检眼镜图像)、公共眼底数据集(约19.9万张彩色眼底图像,部分包含GAMMA OCT数据)以及公共OCT数据集(约48.9万张OCT B扫描图像)。所有数据遵循严格的41列统一数据清单模式,确保了跨源数据的一致性,包括图像标识符、研究/患者信息(匿名哈希)、采集设备信息、临床信息(如诊断分组、病变标签、严重程度)、图像元数据(如模态、解剖部位、分辨率、质量评分)和技术参数(如扫描协议、B扫描索引)。部分队列还提供了像素级的分割掩码,用于血管、视盘/视杯、视网膜层和病变区域等。每张图像都配有5个文本描述。该数据集适用于多种计算机视觉任务,包括图像分类、图像分割、图像到图像转换、文本到图像生成以及无条件图像生成,是进行眼科医学影像分析、模型预训练和迁移学习的宝贵资源。数据集采用混合许可证,使用者需遵守各原始数据源的许可条款,其中私人数据仅限于研究用途。

原始链接

https://huggingface.co/datasets/MaybeRichard/zju-eye-pretrain

访问原始数据

官方服务

如需原始数据获取支持或标注服务,请联系我们。

帮我联系

下载信息

注册下载

Tips: 该数据集需要在对应的数据源网站注册通过后,才能进行数据下载,注册有对应要求,或者需要收费。

暂未开放

公开下载

Tips: 该数据集属于公开下载,应该可以免费公开下载。

免登录

有偿下载

Tips: 该数据集 Qianfanghub 可以协助提供有偿下载服务,注意,服务不针对数据相关产权,只是技术服务费。

提供高速下载与技术交付服务(收技术服务费,非数据销售)

暂未开放

千方医数集,医疗数据集部分,是为社区服务的公开医疗数据集搜索引擎,并不存储或者下载原始的任何数据。 如果您有其他医疗数据需求,可以和客服联系,或者下工单。我们有强大的三甲医疗机构帮助您提供个性化的医疗数据定制、采集、标注服务。

使用方式

数据集获取与加载(Hugging Face datasets)

# 前置依赖: pip install datasets
from datasets import load_dataset

ds = load_dataset("MaybeRichard/zju-eye-pretrain")
print(ds)  # 查看 splits 与字段结构
# 国内网络可先设镜像: import os; os.environ["HF_ENDPOINT"]="https://hf-mirror.com"
git lfs install && git clone https://hf-mirror.com/datasets/MaybeRichard/zju-eye-pretrain

数据说明

ZJU Eye-Pretrain是一个专为医学基础模型预训练及下游任务设计的大规模、统一多源眼科影像数据集。该数据集整合了来自私人采集和25个公开数据集的资源,总计包含超过110万张图像,涵盖26个不同的队列。数据集主要由三部分构成:私人采集的上海Topcon DRI OCT Triton扫频源OCT数据(约41.9万张图像,包含OCT B扫描、彩色眼底图和灰度扫描激光检眼镜图像)、公共眼底数据集(约19.9万张彩色眼底图像,部分包含GAMMA OCT数据)以及公共OCT数据集(约48.9万张OCT B扫描图像)。所有数据遵循严格的41列统一数据清单模式,确保了跨源数据的一致性,包括图像标识符、研究/患者信息(匿名哈希)、采集设备信息、临床信息(如诊断分组、病变标签、严重程度)、图像元数据(如模态、解剖部位、分辨率、质量评分)和技术参数(如扫描协议、B扫描索引)。部分队列还提供了像素级的分割掩码,用于血管、视盘/视杯、视网膜层和病变区域等。每张图像都配有5个文本描述。该数据集适用于多种计算机视觉任务,包括图像分类、图像分割、图像到图像转换、文本到图像生成以及无条件图像生成,是进行眼科医学影像分析、模型预训练和迁移学习的宝贵资源。数据集采用混合许可证,使用者需遵守各原始数据源的许可条款,其中私人数据仅限于研究用途。

数据加载示例(图像类)

from PIL import Image
import glob, os

files = (glob.glob(os.path.join(path, "**", "*.png"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.jpg"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.tif"), recursive=True))
print("图像文件数:", len(files))
img = Image.open(files[0]); print("尺寸/模式:", img.size, img.mode)

# torchvision Dataset 方式:
# from torchvision import datasets
# ds = datasets.ImageFolder(path)  # 要求 子目录=类别

目录组织与标注格式以源站说明和下载后实际文件为准。

完整数据卡:huggingface.co/datasets/MaybeRichard/zju-eye-pretrain

精度瓶颈?数据缺失?

当前公开数据无法满足您的算法精度?千方提供针对 遗传性眼病 的高质量、多模态真实临床数据定制解决方案。

获取专属数据定制方案