CSDI白内障诊断数据集
该数据集包含187张经过专家标注的眼底图像,每张图像均提供白内障严重程度评分和双语诊断描述,属于医学影像与文本多模态数据,主要用于支持自动化白内障筛查、疾病分级以及眼底图像解释等医学人工智能研究方向。
基本信息
资源简介
CSDI白内障诊断数据集是一个经过专家标注的眼底图像集合,包含187张眼底图像,每张图像均附有白内障严重程度评分以及双语(中文和英文)诊断描述。该数据集通过专业医学标注构建,支持基于图像和文本多模态的自动化白内障筛查、疾病分级以及眼底图像解释等研究方向,适用于医学影像分析、计算机辅助诊断和眼科人工智能应用。
下载信息
注册下载
Tips: 该数据集需要在对应的数据源网站注册通过后,才能进行数据下载,注册有对应要求,或者需要收费。
暂未开放公开下载
Tips: 该数据集属于公开下载,应该可以免费公开下载。
免登录有偿下载
Tips: 该数据集 Qianfanghub 可以协助提供有偿下载服务,注意,服务不针对数据相关产权,只是技术服务费。
提供高速下载与技术交付服务(收技术服务费,非数据销售)
暂未开放千方医数集,医疗数据集部分,是为社区服务的公开医疗数据集搜索引擎,并不存储或者下载原始的任何数据。 如果您有其他医疗数据需求,可以和客服联系,或者下工单。我们有强大的三甲医疗机构帮助您提供个性化的医疗数据定制、采集、标注服务。
使用方式
数据集获取
git clone https://github.com/rainyNighti/CSDI.git
curl -L -o repo.zip https://github.com/rainyNighti/CSDI/archive/refs/heads/main.zip
unzip repo.zip
源站 README 摘录(使用方式)
CSDI: A Fine-Grained Fundus Image Dataset of Cataract Severity and Diagnostic Images
The CSDI Cataract Diagnosis Dataset is a curated collection of 187 fundus images with expert annotations, including cataract severity scores and bilingual diagnostic descriptions (English and Chinese). This dataset supports research in automated cataract screening, grading, and fundus image interpretation using both image and text modalities.
This dataset is licensed under CC BY-NC 4.0. See LICENSE.md for details.
📁 Dataset Overview
- Total images: 187
- Image formats:
.pngand.jpg - Annotation file:
CSDI_annotations.csv - Labels: Cataract severity score (0–10), expert-written diagnoses, optic disc localization, optic disc clarity
📂 File Structure
CSDI/
├── csdi/ # Training and evaluation code
├── original_images/ # Folder containing 187 fundus images (.png and .jpg)
│ ├── cataract_001.png
│ ├── cataract_002.jpg
│ └── ...
├── CSDI_annotations.csv # Annotation CSV file (UTF-8 encoded)
├── README.md # Dataset description
├── LICENSE.md # Dataset license (CC BY 4.0)
├── crop_fundus_images.py # Script for cropping fundus images
├── augment_fundus_images.py # Script for image augmentation
├── dataset_split.py # Includes information about the validation data split
├── prompt.py # Prompts for training and inference
└── create_dataset_json.py # Create training and inference JSON files
🗒️ CSV Annotation File (CSDI_annotations.csv)
- The CSV annotation file is encoded in UTF-8 to ensure proper display of English and Chinese characters.
| Column Name | Description |
|---|---|
id |
Image file name (e.g., cataract_001.png) |
score |
Cataract severity score (range 0–10) |
English_diagnosis |
Diagnosis in English |
Chinese_diagnosis |
Diagnosis in Chinese |
original_image_width |
Original image width in pixels |
original_image_height |
Original image height in pixels |
fundus_region_x1 / y1 / x2 / y2 |
Coordinates of the annotated fundus region in pixels; -1 if not visible |
optic_disc_clear |
Optic disc visibility (visible / not visible) |
| `optic_disc_x1 |
数据加载示例(图像类)
from PIL import Image
import glob, os
files = (glob.glob(os.path.join(path, "**", "*.png"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.jpg"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.tif"), recursive=True))
print("图像文件数:", len(files))
img = Image.open(files[0]); print("尺寸/模式:", img.size, img.mode)
# torchvision Dataset 方式:
# from torchvision import datasets
# ds = datasets.ImageFolder(path) # 要求 子目录=类别
目录组织与标注格式以源站说明和下载后实际文件为准。
精度瓶颈?数据缺失?
当前公开数据无法满足您的算法精度?千方提供针对 白内障 的高质量、多模态真实临床数据定制解决方案。




